【发布时间】:2016-04-30 15:00:11
【问题描述】:
我正在使用带有 Spark MLlib 框架的 LDA。 为了确定主题的数量,我尝试:运行 LDA 模型并增加主题数量,然后找到具有最大值对数似然的最佳主题数量。 但是,如果我以相同的方式和相同的输入数据再次运行。我对主题数量有不同的价值。那么你能帮我解决以下两个问题吗:
我必须使用什么值来确定主题数量:logLikelihood 或 logPrior
为什么相同的 LDA 参数和输入数据每次都会产生不同的主题?
以及如何稳定主题生成?
非常感谢。
编辑: 我在运行 LDA 之前通过设置种子找到了解决方案,使用:
DistributedLDAModel.setSeed(long value)
【问题讨论】:
-
您能否展示一下您用于适合您的模型的代码?特别是,我想知道您使用的是
EMLDAOptimizer还是OnlineLDAOptimizer。 -
目前,我正在使用 logLikelihood 值来确定
number of topic的最佳值。
标签: apache-spark lda apache-spark-mllib