【发布时间】:2015-06-17 00:21:18
【问题描述】:
我将基于 LDA 的内容分类为通用主题,例如音乐、技术、艺术、科学
这是我正在使用的过程,
9 个主题 -> 音乐、技术、艺术、科学 等.
9 个文档 -> Music.txt、Technology.txt、Arts.txt、Science.txt等等等等。
我在每个文档(.txt 文件)中填写了大约 10,000 行我认为是“纯”分类内容的内容
然后我对一个测试文档进行分类,看看分类器的训练效果如何
我的问题是,
a.) 这是对文本进行分类的有效方法(使用上述步骤)吗?
b.) 我应该在哪里寻找“纯”主题内容来填充这些文件中的每一个?不太大的来源(文本数据> 1GB)
分类仅针对上述“通用”主题
【问题讨论】:
-
一个经典的免费分类文档来源是 Reuters-21578 文本分类集合,kdd.ics.uci.edu/databases/reuters21578/reuters21578.html。这里引用了许多其他免费和非免费的 NLP 语料库和工具:www-nlp.stanford.edu/links/statnlp.html。
标签: machine-learning nlp classification text-classification document-classification