【发布时间】:2015-09-13 23:33:50
【问题描述】:
我有缺失值的数据,我想为它构建一个分类器。我知道 scikit-learn 将帮助您估算缺失数据的值。但是,就我而言,尚不清楚这是正确的做法,甚至是容易的做法。问题是数据中的特征是相关的,因此现在以合理的方式进行这种插补并不明显。
我知道在 R 中,一些分类器(决策树、随机森林)可以直接处理缺失值,而无需进行任何插补。
scikit learn 0.16.1 中的任何分类器都可以这样做吗?如果可以,我应该如何表示缺失值来帮助它?
我已阅读 scikit learn github 上有关此主题的讨论,但我无法确定哪些实际已实现,哪些尚未实现。
【问题讨论】:
标签: python scikit-learn