【问题标题】:Improve CoreNLP POS tagger and NER tagger?改进 CoreNLP POS 标注器和 NER 标注器?
【发布时间】:2014-11-05 23:04:29
【问题描述】:

CoreNLP 部分语音标注器和名称实体识别标注器开箱即用,非常好,但我想进一步提高准确性,以便整个程序运行得更好。为了解释更多关于准确性的信息——在某些情况下,POS/NER 被错误地标记了。例如:

  • “监督汽车制造”被标记为 NNP-NN-NN

而不是 VB* 或类似的东西,因为它是一个类似动词的短语(我不是语言学家,所以对此持保留态度)。

那么实现准确性提高的最佳方法是什么?

  • 是否有更好的 POS/NER 模型可以整合到 CoreNLP 中?
  • 我应该切换到其他 NLP 工具吗?
  • 或者创建带有例外规则的训练模型?

【问题讨论】:

    标签: java nlp


    【解决方案1】:

    首先,“监督汽车制造”甚至不是一个句子,它本身没有多大意义 :-) 这些模型通常是在整个句子上训练的。如果您在此处输入“他监督汽车制造”[1],它正在使用 CoreNLP,那么您会得到更理智的结果。

    让我们假设您仍然有不准确的结果。除非您使用一些小的示例模型,否则没有“更好”的模型本身。它总是取决于域,甚至“默认”模型也是在某些域上训练的,例如报纸。

    您很可能必须自己训练模型,而不是使用例外规则,而是针对特定的文本域,例如谈论汽车或制造,或具有某种写作风格等的文本。

    [1]http://nlp.stanford.edu:8080/corenlp/process

    【讨论】:

    • 你有训练模型的最佳实践吗?我应该如何挑选数据?它应该以某种方式平衡吗?
    猜你喜欢
    • 2022-09-23
    • 1970-01-01
    • 2011-06-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多