【发布时间】:2013-05-23 09:42:39
【问题描述】:
我正在使用Stanford POS Tagger 执行 POS 标记。标注器只返回输入句子的一种可能的标注。例如,当提供输入句子“The clown weeps.”时,POS 标注器会产生(错误的)“The_DT clown_NN weeps_NNS ._.”。
但是,我的应用程序将尝试解析结果,并且可能会拒绝 POS 标记,因为无法解析它。因此,在此示例中,它将拒绝“The_DT clown_NN weeps_NNS ._”。但会接受“The_DT 小丑_NN weeps_VBZ ._。”我认为这是解析器的低置信度标记。
因此,我希望词性标注器为每个单词的标注提供多个假设,并通过某种置信度值进行注释。通过这种方式,我的应用程序可以选择具有最高可信度的 POS 标记,以实现其目的的有效解析。
我发现没有办法让斯坦福词性标注器为每个单词(甚至整个句子)生成多个(n-best)标注假设。有没有办法做到这一点? (或者,我也可以使用另一个性能相当的 POS 标记器来支持这一点。)
【问题讨论】:
-
可能与这个(也未回答的)问题stackoverflow.com/questions/15574915/…
标签: nlp stanford-nlp pos-tagger