【问题标题】:Topic modeling a corpus with one "majority topic" and several "minority topics"主题建模具有一个“多数主题”和几个“少数主题”的语料库
【发布时间】:2015-05-24 02:16:19
【问题描述】:
我有一个文档集合,大部分都是同一个主题,其余的基本都是随机的主题。我希望将文档分类为它们是关于“多数主题”还是这些随机“少数主题”之一。如果我在这个只有 2 个主题的语料库上使用主题建模算法会发生什么?语料库是否会被划分为“多数主题”和“少数主题”,即使“少数主题”彼此之间可能没有太多相似之处?
【问题讨论】:
标签:
machine-learning
artificial-intelligence
topic-modeling
text-classification
document-classification
【解决方案1】:
您可以为此使用 MonkeyLearn。
您可以创建包含两个主题的自定义分类器:“多数主题”和“少数主题”。您必须在每个类别上添加一些训练样本,以便 MonkeyLearn 可以学习预测每个类别。
训练分类器后,它可以通过其 API 与任何编程语言集成。
您可以在这里免费试用 MonkeyLearn:http://www.monkeylearn.com
如果您有任何问题,请在此处发表评论或给我们发送电子邮件 hello@monkeylearn.com,我随时为您提供帮助。
干杯,
费德里科