【问题标题】:Where to find domain-specific corpus for a text mining task?在哪里可以找到文本挖掘任务的特定领域语料库?
【发布时间】:2014-03-31 01:40:01
【问题描述】:

我正在从事一个专注于计算机技术文档的文本挖掘项目。所以有很多行话。像词性标注这样的任务需要一些训练数据来构建一个词性标注器。而且我认为这些训练数据应该来自同一个域,并且正确标记了“.NET、COM、JAVA”等词。

那么我在哪里可以找到这样的语料库?或者有什么解决办法吗?或者我们可以调整现有的标记器来处理特定领域的任务吗?

【问题讨论】:

  • 这个问题被高度低估了。在您看来,这些术语的正确标签是什么,您的 POS 标注器分配给它们的标签是什么,您为什么需要 POS 标签?

标签: machine-learning nlp data-mining text-mining corpus


【解决方案1】:

不幸的是,您可以在特定领域找到这样的语料库。

第 22 条军规。没有专门数据的通用来源。

就像没有通用软件可以解决特定领域的问题一样。

【讨论】:

  • 是的,我预料到了。我只是想试试这个问题的运气。谢谢。
【解决方案2】:

收集训练数据(和定义特征)将是这个问题中最困难的一步。我确定那里有数据集。但是您的另一种选择是确定一些专注于您感兴趣的领域的期刊或新闻网站,然后抓取它们并拉下文本,也许通过搜索关键字来验证您拉下的每篇文章。我以前这样做是为了开发一个专注于选举的语料库。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-01-07
    • 1970-01-01
    • 2018-08-16
    • 1970-01-01
    • 2015-08-15
    • 1970-01-01
    相关资源
    最近更新 更多