【发布时间】:2022-06-27 04:32:53
【问题描述】:
为什么连贯性会随着主题数量的变化而变化如此之大?
我正在使用 Gensim 的一致性模型来计算各种潜在狄利克雷分配 (LDA) 主题模型的 u_mass 一致性分数,这些模型会改变主题的数量 (k)。我的目标是优化k。
我了解一般情况下,u_mass coherence score 越高越好,所以k应该选择一致性最大化的地方(根据来源here,here和here )。但是,我发现当我绘制连贯性分数时,该图非常不稳定。这也反映在我在网上找到的其他示例中:
有人可以解释为什么连贯性变化如此之大,因为 k 变化?如果我理解正确 - 如果 k 增加并且新主题的单词共现率低,则全局连贯性得分会显着下降。如果 k 再次发生变化,但按主题分组的新词具有较高的共现度,则全局连贯性得分会增加。这就是为什么我们看到变化中k的一致性变化如此之大。
一个小问题; k 是否在我们看到局部一致性峰值的地方进行了优化?
非常感谢任何帮助或其他信息。谢谢!
【问题讨论】:
标签: python nlp gensim lda topic-modeling