【发布时间】:2017-06-15 13:50:16
【问题描述】:
我使用 StanfordCoreNLP 的 NER 来识别实体,包括组织、位置和人员。但是有一些奇怪的东西。 例如,我输入“Cleveland Cavaliers”这样的句子,它会将“Cleveland”识别为“location”,但不会将“Cleveland Cavaliers”识别为组织。 我对 ner 不是很熟悉,也不知道 NER 是如何工作的。我的任务是获取文本中的所有公司名称,我得到的结果不是很令人满意。因此,我想到了两种解决问题的方法。首先是修改dict,插入正确的数据。二是训练模型。但仍有一些问题。
- 第一种方法会有效吗?
- 如果问题1的答案是肯定的,如何修改dict?
此外,https://nlp.stanford.edu/software/crf-faq.shtml#a 的 FAQ 列表提出了训练 ner 模型的方法,但最让我困惑的是 如果我训练了我的模型会得到什么。
-
如果我创建一个包含类似
的数据集"组织'克利夫兰 骑士队”
要训练模型,模型会发生什么? CRFClassifier里面的dict会变吗?
当我输入“Cleveland Cavaliers”并将“Cleveland Cavaliers”识别为组织实体时,CRFClassifier 会修改错误吗?
这些都是我的难题,我正在准备数据集以尝试第二种方式。有人能回答上面的4个问题吗? 谢谢
【问题讨论】:
标签: stanford-nlp