【发布时间】:2017-03-16 10:08:36
【问题描述】:
我正在使用 MaxEnt 词性标注器对语言语料库进行 pos 标注分类。我从理论上知道,增加训练示例通常会提高分类准确性。但是,我观察到,在我的情况下,如果我将 3/4 的数据用于训练并休息用于测试,那么标注器会给出最大 f 测量值。如果我通过将训练数据大小设为整个语料库的 85 或 90℅ 来增加训练数据大小,那么准确性会降低。即使将训练数据大小减少到完整语料库的 50℅,准确性也会降低。
我想知道随着训练示例的增加而导致准确性下降的可能原因。
【问题讨论】:
-
您的测试数据似乎不固定(当您增加训练数据大小时)。您要么使用 1/4 的数据作为测试,要么使用 1/10 的数据。这不是苹果对苹果的比较。你能修复你的测试数据并再次测量性能吗?或者你可以做 k 折交叉验证,增加 k。并报告你看到了什么。
标签: machine-learning nlp text-classification