【问题标题】:Coherence score (u_mass) -18 is good or bad?连贯性分数(u_mass)-18是好是坏?
【发布时间】:2020-05-26 22:22:47
【问题描述】:

我阅读了这个问题 (Coherence score 0.4 is good or bad?),发现一致性得分 (u_mass) 是从 -14 到 14。但是当我进行实验时,我的 u_mass 得分为 -18,c_v 得分为 0.67。我想知道我的 u_mass 分数如何超出范围 (-14, 14)?

更新:我使用了gensim库,扫描了从2到50的主题数。对于u_mass,它从0开始到最低的负点,然后稍微往回走,就像c_v的颠倒版本。

【问题讨论】:

    标签: nlp lda topic-modeling lsa topicmodels


    【解决方案1】:

    我参考了两个来源并发现了相似之处,并且可能会清除我的疑问: https://www.os3.nl/_media/2017-2018/courses/rp2/p76_report.pdf

    https://amp.reddit.com/r/learnmachinelearning/comments/9bcr77/coherence_score_u_mass/

    我相信对于u_mass,图相对于c_v会有一个倒置的趋势倒置,最低的负点是最好的。当然,如果你使用 gensim

    【讨论】:

    • 我不认为这只是颠倒,看看Differences among Topic Coherence Metrics ("u_mass", "c_v", ...) & Choose the Best Threshold Value to Filter Out "Low-quality" Documents,两者都有自己的曲线,而不仅仅是镜像。
    • @questionto42 这取决于数据集,但为了清楚起见,我们有这种趋势。对于 Umass,图表将从顶点之一开始,然后逐渐下降,当然,在它逐渐上升之前,我们确实在某处有一些曲线。 Uv 也会发生同样的事情,但在另一边。
    • 同意,两条曲线非常粗略地颠倒,当然不是镜像,但作为一个非常粗略的趋势,可以在链接中看到(点击...查看图像) .这是你一开始的意思,打扰了。
    • 我稍微修正了答案。干杯!
    • 只是为了让措辞更清楚一点:对于 u_mass,“最低的负点是最好的”,而最高的连贯性达到最高的 c_v。
    【解决方案2】:

    根据original paper中提供的u_mass连贯性分数的数学公式。

    如果 u_mass 接近 0 值意味着完美的连贯性,并且它在值 0 的任一侧波动,取决于所选主题的数量和用于执行主题聚类的数据类型。判断 u_mass 的最佳方法是绘制 u_mass 与不同 K(主题数)值之间的曲线。选择 u_mass 接近 0 的 K。

    你可以参考这个link,它提供了python代码sn-p来绘制不同K和c_v值之间的曲线。在这里,您可以将 c_v 替换为 u_mass 一致性指标。

    我希望这个解释会有所帮助。

    【讨论】:

    • 我用的是gensim,但我的图表不像你说的那样。它从 0 开始到最低点,然后稍微向上回升并在该点波动。它看起来像 c_v 的颠倒版本。我怀疑 gensim 有什么作用?
    • 我可以在这里看到你的图表吗?
    【解决方案3】:

    按照here (pg 13-14) 的说明,这是@Dammio 在他的回答中提到的同一份文件,解释是相反的。在文本中,它说:“根据 UMASS 相干性测量,当 K 增加时,全球主题的相干性会降低。” K 是主题的数量。他们继续说:“为了分析,我们比较模型 K = 6 进行 40 次迭代(局部最小值)和 10 次迭代 哪个表现更好。”在图中,可以清楚地看到它比较了更差的局部最小值和更连贯的局部最大值。这与接受的答案中所说的完全相反。此外,我发现在 Github 帖子中说的完全一样:值越高越好:Link to Github answer

    【讨论】:

      猜你喜欢
      • 2022-06-27
      • 1970-01-01
      • 1970-01-01
      • 2012-01-03
      • 2014-07-23
      • 1970-01-01
      • 1970-01-01
      • 2010-11-26
      • 1970-01-01
      相关资源
      最近更新 更多