【问题标题】:Agreement feature extraction from a text从文本中提取协议特征
【发布时间】:2012-06-20 03:10:20
【问题描述】:

我正在完成一项任务,我必须提取文本中名词的一致性特征...... 协议功能如:

number = singular, plural
person = first, second, third
gender = male, female, neuter
animacy = animate, inanimate

有没有办法从文本中提取这些特征......

【问题讨论】:

  • 你真的必须检查每一行,找到名词标签,然后有一个协议特征列表(你称之为)再次交叉检查行中找到的那个。跨度>
  • 你的意思是我应该检查解析器的每一行或它自己的文本.. 因为我可以通过 POS 标记器提取单数和复数名词。其他的特征呢,能不能用开源的 NLP 来提取呢!
  • stanford-nlp POS 标注器使用Penn Treebank POS tagset。所以不幸的是,您只能从这些标签中访问单数和复数名词。要么您需要搜索具有此类支持功能的标签集,要么手动制作解析器来搜索此类属性。
  • 而且我认为即使是 open-nlp 也使用相同的标签集。

标签: java nlp stanford-nlp opennlp


【解决方案1】:

如果您的数据是英文的,正如您的 cmets 建议的那样,那么名词将永远不会包含人信息,因此我们可以打折扣。

正如其他人所提到的,数字很容易:许多词性标注器区分单数和复数名词。

性别和活力更有趣。在英语中,这些是名词的语义而非句法属性。例如,以句子公主在塔中为例。我们知道 princess 是女性化的和有生命力的,不是因为屈折信息,而是因为我们知道这个词的含义。通过获取大量旧数据并分析其中的代词和照应词来构建本体是可行的。你的算法会寻找这样的例子:

公主看着镜子里的自己。

公主在塔里。她很伤心。

它会(不知何故)princess 是 herself 和 her 的先行词,并从代词的已知性质。当然,现在问题变成了参考解析,这不是微不足道的。以下是最近爱丁堡大学关于该主题的讲座课程的一些参考资料:

  • Denis、Pascal 和 Baldridge, Jason,2008 年。“共指解析的专用模型和重新排序”。在自然语言处理经验方法会议论文集中。 ACL,650-69。
  • Haghighi、Aria 和 Klein, Dan,2010 年。“以实体为中心的模块化模型中的共指解析”。 人类语言技术:计算语言学协会北美分会 2010 年年会。加利福尼亚州洛杉矶,385-93。
  • Lappin、Shalom 和 Leass、Herbert,1994 年。“代词照应解析算法”。 计算语言学 20:535-61。
  • Ng, Vincent, 2010。“监督名词短语共指研究:前 15 年”。 ACL '10:计算语言学协会第 48 次会议论文集。 1396-411。

【讨论】:

  • 感谢 Tommy Herbert,对您的解释非常有帮助,尤其是照应决议……那些没有任何代词与之相关的名字怎么样。我们如何才能弄清楚它的性别和活力。以先生,小姐,女王,女士,勋爵开头的名字呢.....这些词有什么方法或开源一直在做这件事!
  • 哦,我认为这些会容易得多。这是一个相当有限的标题列表。手动编译它并让你的标注器留意它们。不知道有没有现成的开源实现。
猜你喜欢
  • 2019-04-09
  • 2016-09-12
  • 2021-08-09
  • 1970-01-01
  • 2011-03-07
  • 2016-09-11
  • 1970-01-01
  • 2019-04-28
  • 2015-05-21
相关资源
最近更新 更多