【发布时间】:2014-04-16 22:59:34
【问题描述】:
我对我的数据集进行词干分析以进行情绪分析,但收到此错误消息
"结构错误(if (length(n)) n else NA, names = x) : 'names' 属性 [2] 必须与向量 [1] 的长度相同"
请帮忙!
myCorpus<-Corpus(VectorSource(Datasetlow_cost_airline$text))
# Convert to lower case
myCorpus<-tm_map(myCorpus,tolower)
# Remove puntuation
myCorpus<-tm_map(myCorpus,removePunctuation)
# Remove numbers
myCorpus<-tm_map(myCorpus,removeNumbers)
# Remove URLs ?regex = regular expression ?gsub = pattern matching
removeURL<-function(x)gsub("http[[:alnum:]]*","",x)
myCorpus<-tm_map(myCorpus,removeURL)
stopwords("english")
# Add two extra stop words: 'available' and 'via'
myStopwords<-c(stopwords("english"),"available","via","can")
# Remove stopwords from corpus
myCorpus<-tm_map(myCorpus,removeWords,myStopwords)
# Keep a copy of corpus to use later as a dictionary for stem completion
myCorpusCopy<-myCorpus
# Stem word (change all the words to its root word)
myCorpus<-tm_map(myCorpus,stemDocument)
# Inspect documents (tweets) numbered 11 to 15
for(i in 11:15){
cat(paste("[[",i,"]]",sep=""))
writeLines(strwrap(myCorpus[[i]],width=73))
}
# Stem completion
myCorpus<-tm_map(myCorpus,stemCompletion,dictionary=myCorpusCopy)
【问题讨论】:
-
嗯,在我的
Datasethigh_cost_airline$text向量上工作。你能用Datasethigh_cost_airline$text试试看它是否有效吗?有关该数据集的更多信息:stackoverflow.com/help/mcve
标签: r sentiment-analysis stemming