【发布时间】:2015-07-09 06:47:52
【问题描述】:
我有一个字符串向量,其中一些包含标点符号/符号。例如:
words <- ("hi", "my.", "name!", "is98", ""joe"")
我的目标是创建一个包含所有这些单词的向量,但标点符号、数字和符号在向量中被制成它们自己的字符串。所以在这种情况下
("hi", "my", ".", "name", "!", "is", "98", """, "joe", """)
我最初的计划是使用grep 来识别存在所述标点符号的索引,然后遍历它们并使用strsplit 根据所述标点符号划分它们,如下所示:
puncIndex <- grep('[\\"!?.^]', words)
for(i in puncIndex){
strsplit(words[i], '[\\"!?.^]')
}
但是我有几个问题。一个是我意识到strsplit 的结果本身就是一个列表,我不知道如何干净地将每个组件移回原始向量。另一个是即使我在一个词上尝试strsplit,它也只返回第一部分。例如:
strsplit(words[2], ".")
[[1]]
[1] "my"
编辑:添加数字作为要分开的类
【问题讨论】:
标签: regex r nlp tokenize strsplit