【问题标题】:Determine the document ID on Mahout LDA Output确定 Mahout LDA 输出上的文档 ID
【发布时间】:2011-07-04 03:27:00
【问题描述】:

我已经成功运行了 mahout lda,并使用命令 mahout ldatopics 显示了输出。

例如,我的主题是科学和体育。那么输出将如下所示: 话题 0 篮球, 玩, 棒球 话题一 研究, 学习, 哲学

我现在的问题是如何识别单个文章的组或集群。 是否有 ID 号或某种跟踪,以便对于我添加的每篇新文章,它都会被分组或添加到特定的集群/主题。

如果我已经有了集群,下一步是什么?

谢谢

【问题讨论】:

    标签: apache machine-learning cluster-analysis mahout dirichlet


    【解决方案1】:

    我一直在查看源代码,但找不到任何关于计算给定文档主题概率的 theta 矩阵的内容,因为没有输入 Alpha 值来估计每个文档的主题和LDAState 类有一个 logProbWordGivenTopic(int, int) 方法,但没有像 getProbTopicGivenDocument() 这样的方法我只能假设 LDA 的 mahout 实现不处理发现特定文档的主题分布。如果其他人知道得更好,我很乐意犯错。

    【讨论】:

    猜你喜欢
    • 2014-07-02
    • 2011-11-10
    • 2014-11-28
    • 2011-11-27
    • 1970-01-01
    • 2011-05-10
    • 1970-01-01
    • 1970-01-01
    • 2012-06-30
    相关资源
    最近更新 更多