【发布时间】:2015-07-23 15:09:46
【问题描述】:
我目前正在进行一项关于分类器性能比较的研究。为了评估这些性能,我正在计算我拥有的所有数据集上每个分类器的准确性、曲线下面积和平方误差。此外,我需要对一些分类器执行调优参数,以便在准确度方面选择最佳参数,因此需要进行验证测试(我选择了 20% 的数据集)。
有人告诉我,为了使这种比较更有意义,应该对每个分类器的相同集合执行交叉验证。
所以基本上,有没有一种方法可以使用 cross_val_score 方法,以便它始终在所有分类器的相同折叠上运行,或者我应该从头开始重写一些可以完成这项工作的代码?
提前谢谢你。
【问题讨论】:
-
CV 默认为 StratifiedKFold,用于 shuffle=False 的分类。所以你应该得到可重复的折叠。
标签: python machine-learning scikit-learn classification cross-validation