【发布时间】:2017-05-27 22:18:26
【问题描述】:
我有一个包含 58 个样本的数据集。数据集有两列“测量信号”和“people_in_area”。因此,我正在尝试使用 Scikit-learn 训练线性回归模型。目前,我将数据集的 75% 用于训练,25% 用于测试。但是,根据拆分前数据的顺序,我会得到不同的 R 平方值。
我认为由于数据集很小,根据拆分之前数据的顺序,不同的值将保留为 x_test 和 y_test。因此,我正在考虑在我的线性回归模型上使用“交叉验证”来划分测试并随机训练数据多次,训练更多,并且能够进行更多测试,以这种方式获得更可靠的结果.这是正确的做法吗?
【问题讨论】:
-
我建议这个问题更适合“交叉验证”,因为它侧重于技术而不是编程
标签: python scikit-learn linear-regression