【发布时间】:2014-06-04 17:14:44
【问题描述】:
我正在对一组包含 10842 条推文的文本数据进行 k-means 聚类。我将 k 设置为 5,我得到了如下所示的集群
cluster1:booking flight NA
cluster2:航班预订不适用
cluster3:航班预订不适用
cluster4:航班预订不适用
cluster5:booking flight NA
我不明白为什么所有的集群都是一样的??
myCorpus<-Corpus(VectorSource(myCorpus$text))
myCorpusCopy<-myCorpus
myCorpus<-tm_map(myCorpus,stemDocument)
myCorpus<-tm_map(myCorpus,stemCompletion,dictionary=myCorpusCopy)
myTdm<-TermDocumentMatrix(myCorpus,control=list(wordLengths=c(1,Inf)))
myTdm2<-removeSparseTerms(myTdm,sparse=0.95)
m2<-as.matrix(myTdm2)
m3<-t(m2)
set.seed(122)
k<-5
kmeansResult<-kmeans(m3,k)
round(kmeansResult$centers,digits=3)
for(i in 1:k){
cat(paste("cluster",i,":",sep=""))
s<-sort(kmeansResult$centers[i,],decreasing=T)
cat(names(s)[1:3],"\n")
}
【问题讨论】: