【发布时间】:2017-09-25 04:51:43
【问题描述】:
我有大约 150k 个文档的非结构化数据。我正在尝试使用无监督学习算法对这些文档进行分组。目前我在 gensim Python 中使用 LDA(潜在狄利克雷分配)。对于 LDAModel,我通过了 num_topics=20。因此,我的全部 150k 数据分为 20 个主题。
现在我有了这些小组,我有 2 个问题:
- 我应该如何为这些主题分配新文档?
我采取的方法是: 计算每个主题的文档的单词分数总和,并将文档分配给得分最高的主题。然而,这并没有给我带来好的结果。
有没有更好的方法来获得这个?
- 如何分配表示主题的主要关键字?
【问题讨论】:
-
如果您的主题是预定义的,那么这是一个分类问题,而不是一个聚类问题。
-
我已经修改了问题,预定义的含义我给了 20 作为 num_topics 的参数。
标签: python-3.x cluster-analysis gensim lda unsupervised-learning