【问题标题】:Increasing training examples reduces accuracy for maximum entropy classifier增加训练示例会降低最大熵分类器的准确性
【发布时间】:2017-03-16 10:08:36
【问题描述】:

我正在使用 MaxEnt 词性标注器对语言语料库进行 pos 标注分类。我从理论上知道,增加训练示例通常会提高分类准确性。但是,我观察到,在我的情况下,如果我将 3/4 的数据用于训练并休息用于测试,那么标注器会给出最大 f 测量值。如果我通过将训练数据大小设为整个语料库的 85 或 90℅ 来增加训练数据大小,那么准确性会降低。即使将训练数据大小减少到完整语料库的 50℅,准确性也会降低。

我想知道随着训练示例的增加而导致准确性下降的可能原因。

【问题讨论】:

  • 您的测试数据似乎不固定(当您增加训练数据大小时)。您要么使用 1/4 的数据作为测试,要么使用 1/10 的数据。这不是苹果对苹果的比较。你能修复你的测试数据并再次测量性能吗?或者你可以做 k 折交叉验证,增加 k。并报告你看到了什么。

标签: machine-learning nlp text-classification


【解决方案1】:

我怀疑在缩减的测试集中,您选择了极端样本并将更多一般样本添加到您的训练集中,然后您减少了模型知道的测试样本的数量。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2018-09-12
    • 2017-10-09
    • 1970-01-01
    • 2021-10-21
    • 2020-02-29
    • 1970-01-01
    • 1970-01-01
    • 2011-09-30
    相关资源
    最近更新 更多