【发布时间】:2021-05-12 14:48:10
【问题描述】:
假设我使用 gensim 或 sklearn 构建了一个 LDA 主题模型,并将热门主题分配给每个文档。但有些文档与分配的热门主题不匹配。除了尝试不同数量的主题或使用一致性分数来获得最佳主题数量之外,我还可以使用哪些其他技巧来改进我的模型?
【问题讨论】:
标签: gensim lda topic-modeling
假设我使用 gensim 或 sklearn 构建了一个 LDA 主题模型,并将热门主题分配给每个文档。但有些文档与分配的热门主题不匹配。除了尝试不同数量的主题或使用一致性分数来获得最佳主题数量之外,我还可以使用哪些其他技巧来改进我的模型?
【问题讨论】:
标签: gensim lda topic-modeling
LDA 也(半秘密地)采用参数alpha 和beta。将alpha 视为告诉LDA 每个文档应该从多少个主题生成的参数。 beta 是告诉 LDA 每个 word 应该包含多少个主题的参数。你可以玩这些,你可能会得到更好的结果。
但是,LDA 是一种无监督模型,即使是对k、alpha 和beta 的完美设置也会导致一些错误分配的文档。如果您的数据没有很好地预处理,那么您分配的参数几乎无关紧要,它总是会产生很差的结果。
【讨论】: