【问题标题】:Stanford CoreNLP Train custom NER model斯坦福 CoreNLP 训练自定义 NER 模型
【发布时间】:2020-08-30 03:22:03
【问题描述】:

我正在通过使用 crf 训练自定义模型进行一些测试,并且由于我没有适当的训练文件,我想自己制作一个包含 5 个标签和可能 10 个单词的列表,并且计划是以在未来使用更多传入数据不断改进模型。但是我得到的结果有很多误报(它标记了许多与训练文件中的原始单词无关的单词),因为创建的模型是概率性的,并且不仅仅考虑单独的单词

假设我想训练 corenlp 在不关心上下文的情况下检测一小部分单词,是否有一些特殊设置?如果没有,有没有办法计算需要多少数据才能获得准确的模型?

【问题讨论】:

    标签: nlp stanford-nlp crf


    【解决方案1】:

    经过一些测试和研究,发现一个非常适合我的案例的选择是 RegexNER,它以确定性方式工作,也可以与 NER 结合使用。到目前为止,尝试使用较小的规则集并且做得很好。下一步是确定在高流量压力场景(我感兴趣的场景)中的可扩展性和可用性,并与基于 python 的其他解决方案进行比较

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2017-11-27
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-12-04
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多