【发布时间】:2014-10-08 13:19:44
【问题描述】:
直到最近(1 个月前),下面显示的代码允许我将存储在本地文件夹中的一系列 .txt 文档导入 R,创建语料库,对其进行预处理,最后将其转换为文档术语矩阵。我遇到的问题是没有导入文档名称,而是将每个文档列为“字符(0)”。
我的目标之一是对语料库进行主题建模,因此我可以将文档名称与模型生成的主题相关联,这一点很重要。
有人对发生的变化有什么建议吗?或者我该如何解决这个问题?
library("tm")
library("SnowballC")
setwd("C:/Users/Documents/Dataset/")
corpus <-Corpus(DirSource("blog"))
#pre_processing
myStopwords <- c(stopwords("english"))
your_corpus <- tm_map(corpus, tolower)
your_corpus <- tm_map(your_corpus, removeNumbers)
your_corpus <- tm_map(your_corpus, removeWords, myStopwords)
your_corpus <- tm_map(your_corpus, stripWhitespace)
your_corpus <- tm_map(your_corpus, removePunctuation)
your_corpus <- tm_map(your_corpus, stemDocument)
your_corpus <- tm_map(your_corpus, PlainTextDocument)
#creating a doucment term matrix
myDtm <- DocumentTermMatrix(your_corpus, control=list(wordLengths=c(3,Inf)))
dim(myDtm)
inspect(myDtm)
【问题讨论】:
-
我以前遇到过这个问题,但不记得问题/解决方法了。如果在每次操作后检查 your_corpus,您可以看到 id 何时被删除。然后您可以搜索该操作。另外,检查这个答案stackoverflow.com/questions/24501514/…
标签: r import text-mining corpus