【问题标题】:Topic model as a dimension reduction method for text mining -- what to do next?主题模型作为文本挖掘的降维方法——下一步该做什么?
【发布时间】:2015-12-24 13:40:30
【问题描述】:

我对工作流程的理解是运行 LDA -> 提取关键字(例如每个主题的前几个单词),从而降低维度 -> 一些后续分析。

我的问题是,如果我的总体目的是以无监督的方式为文章提供主题,或者将类似的文档聚集在一起,那么 LDA 的运行将直接带您实现目标。为什么要降维,然后传递给后续分析呢?如果可以,LDA之后可以做什么样的后续分析?

还有一个无关紧要的问题——在这里问这个问题还是在交叉验证时问这个问题更好?

【问题讨论】:

  • Cross Validated 不适合问这个问题(个人经验)。数据科学更适合。

标签: machine-learning nlp text-mining lda topic-modeling


【解决方案1】:

我认为交叉验证更适合解决这类问题。无论如何,对于我们为什么需要降维有简单的解释:

  1. 没有降维,向量运算是不可计算的。想象一下两个向量之间的点积,维度为字典大小!真的吗?
  2. 降维后,每个数字携带的信息量更密集。这通常会导致更少的噪音。直观地说,您只保留了有用的信息。

【讨论】:

    【解决方案2】:

    您应该重新考虑您的方法,因为您将概率方法 (LDA) 与线性代数(降维)混合在一起。当您对线性代数感觉更熟悉时,请考虑使用非负矩阵分解。

    另外请注意,您的主题已经构成了降维,无需跳回提取的主题中的热门词。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-12-22
      • 2011-02-07
      • 2016-01-12
      • 1970-01-01
      • 2014-11-11
      • 2016-04-06
      相关资源
      最近更新 更多