【问题标题】:How often should I execute the LDA for whole document corpus?我应该多久为整个文档语料库执行一次 LDA?
【发布时间】:2016-01-13 23:48:03
【问题描述】:

假设我们有一个适度增长的文档语料库,即每天都会有一些新文档添加到这个文档语料库中。对于这些新添加的文档,我可以通过使用 LDA 的推理部分来推断主题分布。我不必为了获得这些新文档的主题分布而再次对所有文档执行 LDA 的整个主题估计 + 推理过程。但是,随着时间的推移,我可能需要再次执行整个主题生成过程,因为自上次执行 LDA 以来新添加的文档数量可能会在文档语料库中添加全新的单词。

现在,我的问题是 - 如何确定两次主题生成执行之间足够好的间隔?对于我们应该多久执行一次整个文档语料库的 LDA,是否有任何一般性建议?

如果我把这个间隔保持得很短,我可能会失去稳定的主题分布,而主题分布会不断变化。如果我将间隔保持得太长,我可能会丢失新的主题和新的主题结构。

【问题讨论】:

    标签: information-retrieval lda topic-modeling


    【解决方案1】:

    我只是在这里大声思考......一个非常简单的想法是从一堆新添加的文档中采样一个文档子集(比如一天的时间)。

    您可以从样本集中的每个文档中提取关键词,并将每个关键词作为查询执行,该索引是从添加这些新文档之前存在的集合版本构建的。

    然后,您可以测量为响应每个查询而检索到的前 K 个文档的平均余弦相似度(并在采样的查询集中对每个查询进行平均)。如果该平均相似度小于预定义的阈值,则可能表明新文档与现有文档不太相似。因此,对整个集合重新运行 LDA 可能是一个好主意。

    【讨论】:

      猜你喜欢
      • 2015-01-24
      • 2016-09-24
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-01-04
      • 2011-05-12
      相关资源
      最近更新 更多