【问题标题】:How to improve the accuracy of ner of StanfordCoreNLP?如何提高 StanfordCoreNLP ner 的准确率?
【发布时间】:2017-06-15 13:50:16
【问题描述】:

我使用 StanfordCoreNLP 的 NER 来识别实体,包括组织、位置和人员。但是有一些奇怪的东西。 例如,我输入“Cleveland Cavaliers”这样的句子,它会将“Cleveland”识别为“location”,但不会将“Cleveland Cavaliers”识别为组织。 我对 ner 不是很熟悉,也不知道 NER 是如何工作的。我的任务是获取文本中的所有公司名称,我得到的结果不是很令人满意。因此,我想到了两种解决问题的方法。首先是修改dict,插入正确的数据。二是训练模型。但仍有一些问题。

  1. 第一种方法会有效吗?
  2. 如果问题1的答案是肯定的,如何修改dict?

此外,https://nlp.stanford.edu/software/crf-faq.shtml#a 的 FAQ 列表提出了训练 ner 模型的方法,但最让我困惑的是 如果我训练了我的模型会得到什么。

  1. 如果我创建一个包含类似

    的数据集

    "组织'克利夫兰 骑士队”

    要训练模型,模型会发生什么? CRFClassifier里面的dict会变吗?

  2. 当我输入“Cleveland Cavaliers”并将“Cleveland Cavaliers”识别为组织实体时,CRFClassifier 会修改错误吗?

这些都是我的难题,我正在准备数据集以尝试第二种方式。有人能回答上面的4个问题吗? 谢谢

【问题讨论】:

    标签: stanford-nlp


    【解决方案1】:

    我认为第一个解决方案技术性不是很强,每次您想标记一家新公司时,您都需要更新您的字典。 我更喜欢你的第二个解决方案,我之前这样做过,并训练了一个新模型来标记我的句子。 如果你有一个足够大且标记正确的好的语料库,可能需要一些时间来训练,但值得付出努力。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-01-04
      • 2018-07-03
      • 2021-11-13
      • 2023-04-02
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多