【发布时间】:2017-05-10 13:52:31
【问题描述】:
我正在使用 sklearn 中的 RFECV 模块来找到最佳的特征数量,以在 2 折上产生最高的交叉验证。我使用岭回归器作为我的估计器。
rfecv = RFECV(estimator=ridge,step=1, cv=KFold(n_splits=2))
rfecv.fit(df, y)
我的数据集中有 5 个使用标准缩放器标准化的特征。
我将对我的数据运行 RFECV,它会说 2 个功能是最佳的。但是当我删除回归系数最低的特征之一并重新运行 RFECV 时,它现在说 3 个特征是最佳的。
当我一次完成所有功能时(正如递归应该做的那样),我发现 3 实际上是最佳的。
我已经用其他数据集对此进行了测试,发现当我一次删除一个特征并重新运行 RFECV 时,最佳特征数量会发生变化。
我可能遗漏了一些东西,但这不正是 RFECV 应该解决的问题吗? 感谢您对 RFECV 的任何其他见解。
【问题讨论】:
标签: python-2.7 recursion scikit-learn feature-selection