【发布时间】:2012-06-20 03:10:20
【问题描述】:
我正在完成一项任务,我必须提取文本中名词的一致性特征...... 协议功能如:
number = singular, plural
person = first, second, third
gender = male, female, neuter
animacy = animate, inanimate
有没有办法从文本中提取这些特征......
【问题讨论】:
-
你真的必须检查每一行,找到名词标签,然后有一个协议特征列表(你称之为)再次交叉检查行中找到的那个。跨度>
-
你的意思是我应该检查解析器的每一行或它自己的文本.. 因为我可以通过 POS 标记器提取单数和复数名词。其他的特征呢,能不能用开源的 NLP 来提取呢!
-
stanford-nlp POS 标注器使用
Penn Treebank POS tagset。所以不幸的是,您只能从这些标签中访问单数和复数名词。要么您需要搜索具有此类支持功能的标签集,要么手动制作解析器来搜索此类属性。 -
而且我认为即使是 open-nlp 也使用相同的标签集。
标签: java nlp stanford-nlp opennlp