【发布时间】:2018-05-22 02:13:31
【问题描述】:
目标:我想找到一种方法来对字符向量进行分组,例如:
x <- c("a800k blue 5", "a800j", "bb-blah5", "a800 7", "bb-blah2", "bb-blah3")
按照“潜在客户匹配”的形式划分为最少元素的组,以便在grep 搜索中调用它们。所以上面玩具示例的解决方案是:
solution <- c("a800", "bb-blah")
因为使用模式“a800”对 x 进行grep 搜索会产生以“a800”开头的所有 3 个元素。
注意:我可以对将包含在向量中的字符串做很少的假设。长度会在几个字符串和相当长的字符串(可能 10 个或更多)之间变化,其中包含数字、字母、空格和一些让生活非常困难的特殊字符的组合。
所以我想要一个像intersect 这样工作的函数,也许,但在每个单独的字符串上。
有什么想法吗?
【问题讨论】:
标签: r pattern-matching