【发布时间】:2020-01-13 02:40:27
【问题描述】:
例如:
句子:世界上最好的产品是雀巢饼干。
实体:
品牌:雀巢
产品:雀巢饼干
上述实体是否有效,或者我应该将它们标记为:
实体:
品牌:雀巢
产品:饼干
它会影响模型性能吗?
【问题讨论】:
标签: nlp stanford-nlp spacy feature-extraction named-entity-recognition
例如:
句子:世界上最好的产品是雀巢饼干。
实体:
品牌:雀巢
产品:雀巢饼干
上述实体是否有效,或者我应该将它们标记为:
实体:
品牌:雀巢
产品:饼干
它会影响模型性能吗?
【问题讨论】:
标签: nlp stanford-nlp spacy feature-extraction named-entity-recognition
实体识别器仅限于预测非重叠、非嵌套跨度。训练数据应遵循相同的约束。如果您愿意,您可以在数据中包含两个带有不同注释的句子。不过,我不确定这是否会伤害或帮助您的表现。
如果您希望 spaCy 学会恢复这两个注释,您可以在管道中有两个 EntityRecognizer 实例。您需要将实体注释移动到扩展属性中,因为您不希望第二个实体识别器覆盖第一个实体设置的实体。
后果:
如果您想拥有单个 NER 标记器,您必须按如下方式标记:
实体:品牌:雀巢产品:Cookie
如果您想训练两个单独的 NER 标注器(一个用于 BRAND,一个用于 PRODUCT),那么您可以这样做:
实体:品牌:雀巢产品:雀巢饼干
【讨论】: