【发布时间】:2016-11-14 09:25:07
【问题描述】:
我正在尝试使用 Mallet,但在主题建模等方面几乎没有经验。我的目的是获得 M 个我拥有的文档的 N 个主题现在,用一个或多个主题对每个文档进行分类(文档 1 = 主题 1;文档 2 = 主题 2 可能还有主题 3),并在未来用这个结果对新文档进行分类。我首先尝试使用bigartm,但在这个程序中没有发现任何分类,只有主题建模。所以 Mallet,我创建了一个 corpus.txt 文件,格式如下:
Doc.num. \t(tab) Label(actualy 1 everywhere) \t Text
1 1 some text of document to classify
2 1 another doc text
...
现在我可以在将此文件转换为槌的特征序列格式后从该文件中获取主题
bin/mallet import-file --input corpus.txt --output foo.mallet--keep-sequence
然后从中获取主题
bin/mallet train-topics --input foo.mallet --output-state state.gz --output-topic-keys topic-keys.txt --output-doc-topics doc-topics.txt
所以现在普遍的问题是在 mallet(训练分类器?)中使用什么来将每个现有文档分配给我找到的主题,并保存此结果以应用于我想用该主题分类的未来文档。
谢谢
【问题讨论】:
标签: topic-modeling mallet