【发布时间】:2014-09-21 03:07:46
【问题描述】:
我的问题是我想对具有多个分类变量的数据进行特征选择。我在pandas 中使用了get_dummies 来为这些分类变量生成所有稀疏矩阵。我的问题是 sklearn 如何知道一个特定的稀疏矩阵实际上属于一个特征并选择/删除它们?例如,我有一个名为 city 的变量。该变量有纽约、芝加哥和波士顿三个水平,因此稀疏矩阵如下所示:
[1,0,0]
[0,1,0]
[0,0,1]
如何告知 sklearn 在这三个“列”中实际上属于一个特征,即城市,不会最终选择纽约,并删除芝加哥和波士顿?
非常感谢!
【问题讨论】:
标签: python scikit-learn feature-selection