【问题标题】:Required training data size for retraining Stanford NER重新训练斯坦福 NER 所需的训练数据量
【发布时间】:2018-11-28 08:34:43
【问题描述】:

可靠地重新训练斯坦福 NER 模型需要多少训练数据(最少)?如果我们生成手动注释的训练数据,10000 句是否足以训练模型提取实体——组织名称和技术名称?

【问题讨论】:

    标签: stanford-nlp


    【解决方案1】:

    所需的数据量不是简单的计算。您必须考虑到训练数据的多样性以及目标数据的多样性。我们对 CoNLL 2003 数据进行了一些实验,发现如果我们仔细选择要训练的标记/句子,使用 AllenNLP 工具包和 1/6 的数据可以获得 90% 的准确率。本质上,这意味着训练几个句子并查看哪些标记最不确定,然后将包含这些标记的句子添加到训练集中并重复。

    这意味着您不应该期望 10K 句子是某种神奇的数字。如果您有大量句子可供选择训练,最好想出一种选择不同句子的方法。

    【讨论】:

      【解决方案2】:

      对于重新训练 NER 模型没有明确的最小训练数据量;一般来说,您提供的数据越多,准确性就会不断提高。我的印象——我应该强调这只是我个人的直觉——是 10k 句子可能或多或少足以训练一个像样的 NER 系统。例如,CoNLL 2003 共享任务训练了 15k 个句子 (http://www.cnts.ua.ac.be/conll2003/pdf/14247tjo.pdf)。

      【讨论】:

        猜你喜欢
        • 2017-11-27
        • 1970-01-01
        • 1970-01-01
        • 2023-03-22
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2016-06-20
        • 2020-08-30
        相关资源
        最近更新 更多