【问题标题】:Train Spacy NER model with 'en_core_web_sm' as base model使用“en_core_web_sm”作为基础模型训练 Spacy NER 模型
【发布时间】:2020-02-17 14:31:11
【问题描述】:

我正在使用 Spacy 用新实体训练我的 NER 模型,并且我使用 en_core_web_sm 模型作为我的基本模型,因为我还想检测基本实体(ORGPERSONDATE 等)。我在未标记的句子上运行 en_core_web_sm 模型,并将它们的注释添加到我的训练集中。

完成后,现在我想为新实体创建训练数据。例如,我想添加一个名为FRUIT 的新实体。我有一堆要注释的句子(除了之前使用en_core_web_sm 注释的那些)。句例为:

“詹姆斯喜欢吃苹果”。

我的问题是:我还需要将“James”注释为PERSON 以及注释“apples”吗? " 作为FRUIT?或者我是否不需要这样做,因为我已经有另外一堆句子,之前使用en_core_web_sm 模型用PERSON 实体注释。

【问题讨论】:

    标签: machine-learning nlp spacy named-entity-recognition


    【解决方案1】:

    简答:

    是的,如果您想保持模型精确。

    长答案:

    NER 是使用机器学习算法实现的。这些基于学习的分布和周围的令牌将令牌分类为实体。

    因此,如果您提供了多个带注释文本的样本,而没有将一个词(标记)标记为它通常表示的特定实体,则您可能会通过向模型提供该标记不重要的样本来影响您的模型精度。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2020-02-03
      • 1970-01-01
      • 2020-04-28
      • 1970-01-01
      • 1970-01-01
      • 2021-04-08
      • 1970-01-01
      相关资源
      最近更新 更多