【问题标题】:R, text associations with categoryR,与类别的文本关联
【发布时间】:2014-06-03 08:41:49
【问题描述】:

我有两列,第一列是“类”(5 个类别),第二列是“文本”。我已经设法将文本列加载为向量corpus = Corpus(VectorSource(data$Text))

我最终希望将每一行中的文本列表减少为与类相关的唯一术语。

input=read.csv("input.csv",stringsAsFactors=FALSE)
library(tm)
library(SnowballC)
corpus = Corpus(DataframeSource(input))
corpus = tm_map(corpus, tolower)
corpus = tm_map(corpus, removeWords, c("apple", stopwords("english")))
corpus = tm_map(corpus, stemDocument)
corpus = tm_map(corpus, stripWhitespace)
dtm = DocumentTermMatrix(corpus,control=list(weighting=weightTfIdf, minWordLength=2))

当我查看语料库时,它似乎忽略了第一列,即“类”列。我正在寻找代码来查找哪些单词与不同的类类别高度相关,即与类 1 相关,但与其他类无关。

谢谢

【问题讨论】:

    标签: r text tm


    【解决方案1】:

    你有一个错字:

    corpus = Corpus(DataframeSrouce(input))
    

    改成:

    corpus = Corpus(DataframeSource(input))
    

    【讨论】:

      猜你喜欢
      • 2011-11-05
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多