【问题标题】:Overfitted model performs better in test set过拟合模型在测试集中表现更好
【发布时间】:2019-04-12 18:36:20
【问题描述】:

我已经问过这个问题here,但那里的人似乎并不活跃。

同一任务有两种模型:

model_1: 训练集准确率 98%,测试集准确率 54%。
model_2: 训练集准确率 48%,测试准确率 47%设置。

根据上面的统计数据,我们可以说 model_1 过拟合训练集。
Q1:我们可以说 model_2 欠拟合吗?Q2:如果 model_1 在测试集上的表现优于 model_2,为什么它是不好的选择?

【问题讨论】:

  • AI Stack Exchange 它不适合解决此类问题(也不是这样);你应该试试Cross Validated 和/或Data Science(我建议前者)...

标签: machine-learning statistics deep-learning


【解决方案1】:

引用Ian Goodfellow's book, Chapter 5.2

我们必须记住,虽然更简单的函数更有可能 泛化(在训练和测试误差之间有一个小的差距),我们 仍然必须选择一个足够复杂的假设来实现低 训练错误。

【讨论】:

    【解决方案2】:

    Q1 是的,model_2 欠拟合。

    Q2 因为,model_2 只记住答案而不是泛化。因此,训练集和测试集之间的差异越大,测试集上的性能就会越差。

    【讨论】:

      【解决方案3】:

      首先是一些初步的观点:

      知道任务是否是二进制任务会很有用。在这种情况下,您将获得非常接近随机选择的性能。所以基本上你的模型没有从训练集中学习。

      另一个有用的信息是了解两个模型的训练集是否相同(相同的拆分测试/训练)。因为两个模型之间 7% 的差异可能只是样本分裂造成的随机噪声。

      最后,要说明 model_2 比 model_1 更好,您需要进行更深入的分析。两个模型之间的差异很可能没有统计学意义。

      模型过拟合的事实告诉您它在测试集上的泛化效果不佳。通过更好地选择您的设计,您可以提高性能并使系统对看不见的样本更加稳健。不使用过拟合系统的原因是,在特定的测试/验证集上实现了 54% 的准确度,并且由于模型缺乏通用性和鲁棒性,新的未见值可能会有很大差异。

      【讨论】:

        猜你喜欢
        • 2020-04-16
        • 2014-05-27
        • 2021-02-05
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2012-04-25
        相关资源
        最近更新 更多