【问题标题】:Coherence scores (u_mass) for LDA models very volatile when varying the number of topicsLDA 模型的连贯性分数 (u_mass) 在改变主题数量时非常不稳定
【发布时间】:2022-06-27 04:32:53
【问题描述】:

为什么连贯性会随着主题数量的变化而变化如此之大?

我正在使用 Gensim 的一致性模型来计算各种潜在狄利克雷分配 (LDA) 主题模型的 u_mass 一致性分数,这些模型会改变主题的数量 (k)。我的目标是优化k

我了解一般情况下,u_mass coherence score 越高越好,所以k应该选择一致性最大化的地方(根据来源here,here和here )。但是,我发现当我绘制连贯性分数时,该图非常不稳定。这也反映在我在网上找到的其他示例中:

My graph

Another example

Another example

有人可以解释为什么连贯性变化如此之大,因为 k 变化?如果我理解正确 - 如果 k 增加并且新主题的单词共现率低,则全局连贯性得分会显着下降。如果 k 再次发生变化,但按主题分组的新词具有较高的共现度,则全局连贯性得分会增加。这就是为什么我们看到变化中k的一致性变化如此之大。

一个小问题; k 是否在我们看到局部一致性峰值的地方进行了优化?

非常感谢任何帮助或其他信息。谢谢!

【问题讨论】:

    标签: python nlp gensim lda topic-modeling


    【解决方案1】:

    我无法回答你的问题,但我有一个问题要问你:你是如何计算这些连贯性分数的?

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-06-29
      • 2014-07-16
      • 2012-03-25
      相关资源
      最近更新 更多