【发布时间】:2015-07-07 19:57:14
【问题描述】:
我正在使用 Scikit Learn 的线性回归模型来解释时间序列:
from sklearn import linear_model
import numpy as np
X = np.array([np.random.random(100), np.random.random(100)])
y = np.array(np.random.random(100))
regressor = linear_model.LinearRegression()
regressor.fit(X, y)
y_hat = regressor.predict(X)
我想对预测进行交叉验证。据我所知,我不能使用 sklearn 中的 cross_val(如 Kfold),因为它会随机分解结果,我需要按顺序折叠。例如,
data_set = [1 2 3 4 5 6 7 8 9 10]
# first train set
train = [1]
# first test set
test = [2 3 4 5 6 7 8 9 10]
#fit, predict, evaluate
# train set
train = [1 2]
# test set
test = [3 4 5 6 7 8 9 10]
#fit, predict, evaluate
...
# train set
train = [1 2 3 4 5 6 7 8]
# test set
test = [9 10]
#fit, predict, evaluate
是否可以使用 sklearn 做到这一点?
【问题讨论】:
标签: python pandas scikit-learn