【发布时间】:2017-06-01 12:43:41
【问题描述】:
我正在使用tm 和wordcloud 在 R 中执行一些基本的文本挖掘。正在处理的文本包含许多无意义的单词,例如 asfdg、aawptkr,我需要过滤这些单词。
我找到的最接近的解决方案是使用library(qdapDictionaries) 并构建一个自定义函数来检查单词的有效性。
library(qdapDictionaries)
is.word <- function(x) x %in% GradyAugmented
# example
> is.word("aapg")
[1] FALSE
剩下的文本挖掘使用的是:
curDir <- "E:/folder1/" # folder1 contains a.txt, b.txt
myCorpus <- VCorpus(DirSource(curDir))
myCorpus <- tm_map(myCorpus, removePunctuation)
myCorpus <- tm_map(myCorpus, removeNumbers)
myCorpus <- tm_map(myCorpus,foo) # foo clears meaningless words from corpus
问题是is.word() 可以很好地处理数据帧,但如何将其用于corpus 处理?
谢谢
【问题讨论】:
-
你好检查
content_transformer这是你需要的 -
@s.brunel,
content_transformer与修改语料库的函数一起使用,is.word只是返回 True / False