【发布时间】:2016-10-25 23:08:29
【问题描述】:
我对线性回归模型中的交叉验证有疑问。
据我了解,在交叉验证中,我们将数据拆分为(例如)10 份,并从 9 份和用于测试的剩余部分中训练数据。我们重复这个过程,直到我们测试所有折叠,以便每个折叠都被测试一次。
当我们从 9 折训练模型时,我们是否应该得到不同的模型(可能与我们使用整个数据集时创建的模型略有不同)?我知道我们取所有“n”次表演的平均值。
但是,模型呢?结果模型不应该也被视为所有“n”个模型的平均值吗?我看到生成的模型与我们在交叉验证之前使用整个数据集创建的模型相同。如果我们甚至在交叉验证之后考虑整个模型(而不是取所有模型的平均值),那么计算 n 个不同模型的平均性能有什么意义(因为它们是从不同的数据折叠中训练出来的,并且应该是不同,对吧?)
如果我的问题不清楚或太有趣,我深表歉意。 不过感谢您的阅读!
【问题讨论】:
标签: linear-regression cross-validation