【发布时间】:2015-08-25 00:57:00
【问题描述】:
- 我想做的事: 从文本文档中提取基本的传记信息。 (具体的关系提取)
- 解释: 我有 n 个文本文档,其中包含 n 个不同人的传记。我想提取与他们的姓名、年龄、资格、隶属关系和兴趣相对应的信息。
- 我能做什么: 在某些情况下,我使用斯坦福 NER 来提取姓名、年龄和组织。但是,有很多 False Positives 和 False Negatives - 特别是“组织”标签。
- 为什么难: 由于它是传记文件,它包含与相关人员相关的文本。我不能使用其他文档来训练我的分类器,因为对于另一个人来说情况会完全不同。 是的,我当然可以写一些规则。但是,这大大限制了我的域。例如,我编写了提取资格的规则。简单的规则是:如果句子中存在任何程度(在我预先指定的字典中),我可以从该句子中提取实体并尝试找到关系。
- 我的问题: 有没有办法让这个任务自动化?由于我们每次只分析一个文档,请不要建议我使用基于引导的方法。我尝试通过从每个文档中收集特定句子来学习模式,然后应用像 Snowball 这样的基于引导的算法,但失败了。 我知道解析可能对我有帮助,我正在尝试从特定句子的依赖解析中学习一些模式..但是我不确定如何进行。 我曾想过应用远程监督学习,但这也需要大量数据集。
- 个人拍摄(至今): 这样的问题可以通过基于解析的方法增强的基于规则的方法来解决。但是,我还不能结合概率或统计模型将其推广到不同类型的传记。
PS:我想改变我的“个人拍摄”的后一句。因此,寻求帮助。
一个例子:
包含以下文本的文档:
Tim 2010年获得斯坦福大学博士学位。2004年获得麻省理工学院学士(荣誉)学位。目前在ABC公司工作。
应该以如下形式提取事实:[Entity1, Relation, Entity2]
例如:[Tim, affiliation-PhD, Stanford University],
[他(解决给 Tim),隶属关系-学士(荣誉),麻省理工学院] 和
[He(Resolved t Tim), affiliation-works, ABC]
【问题讨论】:
标签: regex machine-learning nlp stanford-nlp text-parsing