【发布时间】:2014-06-03 08:41:49
【问题描述】:
我有两列,第一列是“类”(5 个类别),第二列是“文本”。我已经设法将文本列加载为向量corpus = Corpus(VectorSource(data$Text))
我最终希望将每一行中的文本列表减少为与类相关的唯一术语。
input=read.csv("input.csv",stringsAsFactors=FALSE)
library(tm)
library(SnowballC)
corpus = Corpus(DataframeSource(input))
corpus = tm_map(corpus, tolower)
corpus = tm_map(corpus, removeWords, c("apple", stopwords("english")))
corpus = tm_map(corpus, stemDocument)
corpus = tm_map(corpus, stripWhitespace)
dtm = DocumentTermMatrix(corpus,control=list(weighting=weightTfIdf, minWordLength=2))
当我查看语料库时,它似乎忽略了第一列,即“类”列。我正在寻找代码来查找哪些单词与不同的类类别高度相关,即与类 1 相关,但与其他类无关。
谢谢
【问题讨论】: