【发布时间】:2018-10-15 01:19:59
【问题描述】:
根据 scikit-learn 的文档
sklearn.model_selection.cross_val_score(估计器,X,y=None, 组=无,评分=无,cv=无,n_jobs=1,详细=0, fit_params=None, pre_dispatch='2*n_jobs')
X 和 y
X : array-like 适合的数据。例如可以是一个列表,或者一个 数组。
y : 类数组,可选,默认值:None 目标变量 尝试在监督学习的情况下进行预测。
我想知道 [X,y] 是否是 X_train 并且 y_train 或 [X,y] 应该是整个数据集。在 kaggle 的一些笔记本中,有些人使用整个数据集,有些人使用 X_train 和 y_train。
据我所知,交叉验证只是评估模型并显示您是否过拟合/欠拟合数据(它实际上并没有训练模型)。然后,在我看来,你拥有的数据越多,性能越好,所以我会使用整个数据集。
你怎么看?
【问题讨论】:
-
这取决于你。在某些情况下,人们在训练集上进行整个数据分析(包括交叉验证),最终只使用测试集。
标签: python machine-learning scikit-learn cross-validation data-fitting