【问题标题】:Which classifiers handle missing values in scikit learn 0.16.1哪些分类器在 scikit learn 0.16.1 中处理缺失值
【发布时间】:2015-09-13 23:33:50
【问题描述】:

我有缺失值的数据,我想为它构建一个分类器。我知道 scikit-learn 将帮助您估算缺失数据的值。但是,就我而言,尚不清楚这是正确的做法,甚至是容易的做法。问题是数据中的特征是相关的,因此现在以合理的方式进行这种插补并不明显。

我知道在 R 中,一些分类器(决策树、随机森林)可以直接处理缺失值,而无需进行任何插补。

scikit learn 0.16.1 中的任何分类器都可以这样做吗?如果可以,我应该如何表示缺失值来帮助它?

我已阅读 scikit learn github 上有关此主题的讨论,但我无法确定哪些实际已实现,哪些尚未实现。

【问题讨论】:

标签: python scikit-learn


【解决方案1】:

scikit-learn 中的 RandomForests 目前不处理缺失值 [截至 0.16 和即将到来的 0.17],您确实需要在之前估算这些值。

【讨论】:

  • 非常感谢!您是否碰巧知道是否有计划添加该功能?
  • 目前没有人在研究它,这可能是一项重大任务。不过,我们很快就会有更好的插补策略。根据您的问题,已经存在的简单问题可能就足够了。
  • 再次感谢您。问题是我的特征是相关的,所以要正确地进行插补,我需要使用我认为的每个特征中的剩余变量进行回归。 AFAIK 目前,python ML 库不支持此功能。
  • 这里有一个:github.com/scikit-learn/scikit-learn/pull/4844,但尚未合并。
猜你喜欢
  • 2014-10-04
  • 2020-10-06
  • 2015-07-30
  • 2020-01-28
  • 2020-03-27
  • 2016-02-07
  • 2018-11-13
  • 2014-02-17
  • 2016-02-17
相关资源
最近更新 更多