【问题标题】:Why am I missing the last letter in term document matrix?为什么我错过了术语文档矩阵中的最后一个字母?
【发布时间】:2017-04-06 18:04:24
【问题描述】:

我是 R 新手,我正在尝试使用 csv 文件创建术语文档矩阵。但结果显示,有些单词最后漏掉了字母“e”。如何使术语文档矩阵显示完整的单词?如果您在看到看起来不正确的部分时也能告诉我,那就太好了。谢谢!

library(tm)
posts<-read.csv("/abcd.csv",header=TRUE)
require(tm)
posts<-Corpus(VectorSource(posts))
library(SnowballC)
Corpus<-tm_map(Corpus,content_transformer(tolower))
Corpus<-tm_map(Corpus,stripWhitespace)
Corpus<-tm_map(Corpus,removeWords,stopwords("english"))
Corpus<-tm_map(Corpus,stemDocument)
inspect(Corpus[9])
tdm<-TermDocumentMatrix(Corpus)
tdm
tdm=as.matrix(TermDocumentMatrix(Corpus,control=list(wordLengths=c(1,Inf))))
tdm
rowSums(tdm)

以下是我在此处看到的文件结果中的一些字词。

原因
停机时间
失败
停电
遥不可及

【问题讨论】:

  • 逐行运行脚本。当您找到删除最后一个字母的行时,请告诉我们。如果没有样本数据集,很难说更多。
  • 尝试跳过Corpus&lt;-tm_map(Corpus,stemDocument)这一行,然后运行脚本的其余部分。你看出区别了吗? ;P

标签: r nlp term-document-matrix snowball


【解决方案1】:

因为您正在使用词干提取

词干通常会导致最后几个字符被删除。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-05-04
    • 1970-01-01
    • 2015-07-26
    • 2015-05-19
    • 2018-04-29
    • 1970-01-01
    相关资源
    最近更新 更多