【问题标题】:The same LDA parameters and data input, but I have different topics everytime?相同的LDA参数和数据输入,但我每次都有不同的主题?
【发布时间】:2016-04-30 15:00:11
【问题描述】:

我正在使用带有 Spark MLlib 框架的 LDA。 为了确定主题的数量,我尝试:运行 LDA 模型并增加主题数量,然后找到具有最大值对数似然的最佳主题数量。 但是,如果我以相同的方式和相同的输入数据再次运行。我对主题数量有不同的价值。那么你能帮我解决以下两个问题吗:

我必须使用什么值来确定主题数量:logLikelihood 或 logPrior

为什么相同的 LDA 参数和输入数据每次都会产生不同的主题?

以及如何稳定主题生成?

非常感谢。

编辑: 我在运行 LDA 之前通过设置种子找到了解决方案,使用:

DistributedLDAModel.setSeed(long value)

【问题讨论】:

  • 您能否展示一下您用于适合您的模型的代码?特别是,我想知道您使用的是EMLDAOptimizer 还是OnlineLDAOptimizer
  • 目前,我正在使用 logLikelihood 值来确定 number of topic 的最佳值。

标签: apache-spark lda apache-spark-mllib


【解决方案1】:

您会看到这一点,因为 LDA 在训练和推理步骤中都使用随机性。尝试每次设置相同的种子。

【讨论】:

    猜你喜欢
    • 2020-11-26
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-02-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多