【发布时间】:2014-03-31 01:40:01
【问题描述】:
我正在从事一个专注于计算机技术文档的文本挖掘项目。所以有很多行话。像词性标注这样的任务需要一些训练数据来构建一个词性标注器。而且我认为这些训练数据应该来自同一个域,并且正确标记了“.NET、COM、JAVA”等词。
那么我在哪里可以找到这样的语料库?或者有什么解决办法吗?或者我们可以调整现有的标记器来处理特定领域的任务吗?
【问题讨论】:
-
这个问题被高度低估了。在您看来,这些术语的正确标签是什么,您的 POS 标注器分配给它们的标签是什么,您为什么需要 POS 标签?
标签: machine-learning nlp data-mining text-mining corpus