【发布时间】:2020-05-13 20:27:51
【问题描述】:
我正在解决一个问题,我的文本数据包含大约 10,000 个文档。我创建了一个应用程序,如果用户输入一些随机评论,它应该显示训练数据中存在的所有类似 cmets/文档。 就像在堆栈溢出中一样,如果您提出问题,它会显示之前提出的所有相关问题。 所以如果有人对如何做有任何建议,请回答。
其次,我正在尝试 LDA(Latent Dirichlet Allocation) 算法,我可以在其中获取我的新文档所属的主题,但是我将如何从训练数据中获取类似的文档。还有我应该如何选择LDA中的num_topics。
如果有人对 LDA 以外的算法有任何建议,请告诉我。
【问题讨论】:
标签: python machine-learning nlp lda