【问题标题】:Topic modeling a corpus with one "majority topic" and several "minority topics"主题建模具有一个“多数主题”和几个“少数主题”的语料库
【发布时间】:2015-05-24 02:16:19
【问题描述】:

我有一个文档集合,大部分都是同一个主题,其余的基本都是随机的主题。我希望将文档分类为它们是关于“多数主题”还是这些随机“少数主题”之一。如果我在这个只有 2 个主题的语料库上使用主题建模算法会发生什么?语料库是否会被划分为“多数主题”和“少数主题”,即使“少数主题”彼此之间可能没有太多相似之处?

【问题讨论】:

    标签: machine-learning artificial-intelligence topic-modeling text-classification document-classification


    【解决方案1】:

    您可以为此使用 MonkeyLearn。

    您可以创建包含两个主题的自定义分类器:“多数主题”和“少数主题”。您必须在每个类别上添加一些训练样本,以便 MonkeyLearn 可以学习预测每个类别。

    训练分类器后,它可以通过其 API 与任何编程语言集成。

    您可以在这里免费试用 MonkeyLearn:http://www.monkeylearn.com

    如果您有任何问题,请在此处发表评论或给我们发送电子邮件 hello@monkeylearn.com,我随时为您提供帮助。

    干杯,

    费德里科

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2017-04-03
      • 1970-01-01
      • 2013-05-22
      • 1970-01-01
      • 1970-01-01
      • 2016-09-24
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多