【问题标题】:Information Extraction from a document, with not much training set从文档中提取信息,没有太多的训练集
【发布时间】:2015-08-25 00:57:00
【问题描述】:
  • 我想做的事: 从文本文档中提取基本的传记信息。 (具体的关系提取)
  • 解释: 我有 n 个文本文档,其中包含 n 个不同人的传记。我想提取与他们的姓名、年龄、资格、隶属关系和兴趣相对应的信息。
  • 我能做什么: 在某些情况下,我使用斯坦福 NER 来提取姓名、年龄和组织。但是,有很多 False Positives 和 False Negatives - 特别是“组织”标签。
  • 为什么难: 由于它是传记文件,它包含与相关人员相关的文本。我不能使用其他文档来训练我的分类器,因为对于另一个人来说情况会完全不同。 是的,我当然可以写一些规则。但是,这大大限制了我的域。例如,我编写了提取资格的规则。简单的规则是:如果句子中存在任何程度(在我预先指定的字典中),我可以从该句子中提取实体并尝试找到关系。
  • 我的问题: 有没有办法让这个任务自动化?由于我们每次只分析一个文档,请不要建议我使用基于引导的方法。我尝试通过从每个文档中收集特定句子来学习模式,然后应用像 Snowball 这样的基于引导的算法,但失败了。 我知道解析可能对我有帮助,我正在尝试从特定句子的依赖解析中学习一些模式..但是我不确定如何进行。 我曾想过应用远程监督学习,但这也需要大量数据集。
  • 个人拍摄(至今): 这样的问题可以通过基于解析的方法增强的基于规则的方法来解决。但是,我还不能结合概率或统计模型将其推广到不同类型的传记。

PS:我想改变我的“个人拍摄”的后一句。因此,寻求帮助。

一个例子:
包含以下文本的文档:
Tim 2010年获得斯坦福大学博士学位。2004年获得麻省理工学院学士(荣誉)学位。目前在ABC公司工作。

应该以如下形式提取事实:[Entity1, Relation, Entity2]
例如:[Tim, affiliation-PhD, Stanford University],
[他(解决给 Tim),隶属关系-学士(荣誉),麻省理工学院] 和
[He(Resolved t Tim), affiliation-works, ABC]

【问题讨论】:

    标签: regex machine-learning nlp stanford-nlp text-parsing


    【解决方案1】:

    举个例子会有所帮助。例如,如果传记是结构化的,那么您可以在 bash 脚本中使用 AWK 或 GREP。如果您还没有考虑过该选项,请发布一个示例供我们参考。

    另一种选择是使用 Amazon Turk 或其他人工微任务工具。您可以花相对较少的钱让人工为您提取信息。诸如 CrowdFlower 之类的一些工具提供了考虑到工人过去表现的结果的统计分析。您可以使用冗余和投票来进一步完善您的结果。我过去使用过 CrowdFlower,并获得了非常好的结果。他们已经改变了他们的商业模式,专注于大客户,所以这可能不再是一种选择。我将从土耳其人开始。

    【讨论】:

    • 谢谢鲍勃。我已经发布了一个例子。那是你要找的吗?文档大多是半结构化或非结构化的。
    • 我打算用Turk,但还没想清楚是先打标签,再找关系,还是采用其他策略。我使用的数据集需要标记,如您所见,这不是斯坦福 NER 可以解决的传统标记问题。在这种情况下,我必须进行手动标记。我可以标记自己,也可以选择土耳其人。但是,我不确定后一种情况的真实性。有什么想法吗?
    • 好的,正则表达式不合适。
    • 我用过 CrowdFlower 几次,非常正宗。他们使用来自各种网络的工人,包括 Mechanical Turk。您可以使用几个不同的控件。最重要的是控制问题。作为研究人员,您完成一组控制任务并注释您的答案。然后,您让工人完成例如 8 个任务的块。在 8 中,2 是您的控件,6 是新的。您使用 2 来验证工人并向工人提供反馈。如果其中一个或两个控件的答案不正确,则您将放弃 6 个新任务的答案。
    • 工人可以看到您对他们回答错误的控制问题的注释,以更好地了解您希望如何完成任务。如果一个工作人员的正确响应率低于规定的阈值,那么他们将从工作人员池中删除,并且他们的所有结果都将从数据中删除。当我使用它们时,CrowdFlower 不会对被丢弃的工作收费。 CrowdFlower 还使用您项目中工作人员的生命周期统计数据来进一步提供数据的置信度。
    【解决方案2】:

    您可能想看看斯坦福大学的这个产品:

    http://nlp.stanford.edu/software/openie.shtml

    【讨论】:

    • 谢谢!这是桶中的一个新工具。开放式 IE 在扩展不同类型的文档方面有多成功?
    猜你喜欢
    • 1970-01-01
    • 2018-07-31
    • 2020-06-19
    • 2012-07-06
    • 1970-01-01
    • 1970-01-01
    • 2013-03-09
    • 1970-01-01
    • 2012-07-01
    相关资源
    最近更新 更多