【问题标题】:Shouldn't we take average of n models in cross validation in linear regression?我们不应该在线性回归的交叉验证中取 n 个模型的平均值吗?
【发布时间】:2016-10-25 23:08:29
【问题描述】:

我对线性回归模型中的交叉验证有疑问。

据我了解,在交叉验证中,我们将数据拆分为(例如)10 份,并从 9 份和用于测试的剩余部分中训练数据。我们重复这个过程,直到我们测试所有折叠,以便每个折叠都被测试一次。

当我们从 9 折训练模型时,我们是否应该得到不同的模型(可能与我们使用整个数据集时创建的模型略有不同)?我知道我们取所有“n”次表演的平均值。

但是,模型呢?结果模型不应该也被视为所有“n”个模型的平均值吗?我看到生成的模型与我们在交叉验证之前使用整个数据集创建的模型相同。如果我们甚至在交叉验证之后考虑整个模型(而不是取所有模型的平均值),那么计算 n 个不同模型的平均性能有什么意义(因为它们是从不同的数据折叠中训练出来的,并且应该是不同,对吧?)

如果我的问题不清楚或太有趣,我深表歉意。 不过感谢您的阅读!

【问题讨论】:

    标签: linear-regression cross-validation


    【解决方案1】:

    答案很简单:您使用(重复)交叉验证 (CV) 的过程来为模型获得相对稳定的性能估计,而不是改进它。

    考虑尝试不同的模型类型和参数化,它们以不同的方式非常适合您的问题。使用 CV,您可以获得关于每种模型类型和参数化如何对看不见的数据执行的许多不同估计。从这些结果中,您通常会选择一种非常适合的模型类型 + 您将使用的参数化,然后在所有(训练)数据上再次对其进行训练。多次执行此操作的原因(具有重复的不同分区,每个分区使用不同的分区拆分)是为了获得性能的稳定估计 - 这将使您能够例如查看平均/中值性能及其分布(会为您提供有关模型通常表现如何以及幸运/不幸并获得更好/更差结果的可能性的信息)。

    还有两件事:

    • 通常,使用 CV 最终会改善您的结果 - 仅仅是因为您采用了更适合该工作的模型。
    • 您提到采用“平均”模型。这实际上以“模型平均”的形式存在,您可以对多个可能经过不同训练的模型的结果进行平均以获得单个结果。这是使用ensemble 模型而不是单个模型的一种方法。也适合那些想用CV到底选择合理模型的人。

    【讨论】:

      【解决方案2】:

      我喜欢你的想法。我想你刚刚偶然发现了随机森林: https://en.wikipedia.org/wiki/Random_forest

      【讨论】:

        【解决方案3】:

        如果没有重复的 cv,当您在新数据上对其进行评分时,您看似最好的模型很可能只是一个平庸的模型...

        【讨论】:

          【解决方案4】:

          我认为由于在所问问题中使用了“模型”一词,因此提出的某些答案存在一些混淆。如果我猜对了,你指的是在 K 折交叉验证中我们学习 K 不同的预测变量(或决策函数),你称之为“模型”(这是一个坏主意,因为在机器学习中我们也进行模型选择,即在预测变量系列之间进行选择,这可以使用交叉验证来完成)。交叉验证通常用于超参数选择或在不同算法或不同预测变量系列之间进行选择。一旦选择了这些,最常见的方法是从所有数据中重新学习具有所选超参数和算法的预测器。 但是,如果优化的损失函数相对于预测器是凸的,则可以简单地平均从每个折叠中获得的不同预测器。 这是因为对于凸风险,预测变量的平均值的风险总是小于单个风险的平均值。

          平均(与再训练)的优点和缺点如下 优点:(1)在每一折中,您对保留集所做的评估为您提供了对您所获得的那些预测变量的风险的无偏估计,而对于这些估计,唯一的不确定性来源是由于估计保留数据的经验风险(损失函数的平均值)。 这应该与重新训练时使用的逻辑形成对比,即交叉验证风险是对“给定学习算法风险的预期值”(而不是给定预测变量)的估计,因此如果您从相同分布的数据中重新学习,您应该具有平均相同水平的性能。但请注意,这是平均值,当从整个数据重新训练时,这可能会上升或下降。换句话说,由于您将进行再培训,因此还有一个额外的不确定性来源。 (2) 超参数的选择完全符合您在每个折叠中用于学习的数据点的数量。如果你从整个数据集中重新学习,超参数的最优值在理论上和实践中已经不一样了,所以在重新训练的想法中,你真的会祈祷,希望你选择的超参数仍然没问题对于更大的数据集。 如果你使用了留一法,显然没有问题,如果数据点的数量很大,CV 为 10 倍,你应该没问题。但是如果你是从 5 倍 CV 的 25 个数据点中学习,那么 20 个点的超参数与 25 个点的超参数并不完全相同......

          缺点:嗯,直觉上你不会从一次训练所有数据中受益

          不幸的是,这方面的理论很少,但以下两篇论文,尤其是第二篇论文,精确地考虑了 K-fold CV 预测变量的平均或聚合。

          Jung, Y.(2016 年)。通过高维模型中的交叉验证分数进行有效的调整参数选择。国际数学与计算科学杂志,10(1),19-25。

          Maillard, G.、Arlot, S. 和 Lerasle, M.(2019 年)。聚合保留。 arXiv 预印本 arXiv:1909.04890。

          【讨论】:

            猜你喜欢
            • 2017-05-27
            • 2018-09-06
            • 2021-06-06
            • 1970-01-01
            • 2021-05-06
            • 1970-01-01
            • 2018-09-01
            • 1970-01-01
            • 2021-01-25
            相关资源
            最近更新 更多