【发布时间】:2017-04-08 01:04:15
【问题描述】:
Scikit-Learn(或一般的算法)中是否有任何特征选择方法可以赋予属性的能力/预测能力/重要性以预测特定目标的权重?例如,@ 987654323@,对 4 个属性权重中的每一个进行排序,以分别预测 3 种鸢尾花,但对于具有约 1k-10k 属性的更复杂的数据集。
我正在寻找类似于来自RandomForestClassifier 的feature_importances_ 的东西。但是,RandomForestClassifer 为整个预测过程中的每个属性赋予了权重。权重不需要加起来,但我想找到一种方法将特定属性子集与特定目标相关联。
首先,我尝试“过度拟合”模型以丰富特定目标,但目标之间的结果似乎没有太大变化。其次,我尝试通过找出哪些属性具有最大的变化来走排序路线,但这并不能直接转化为预测能力。第三,我尝试了稀疏模型,但遇到了与使用feature_importances_ 相同的问题。
一个指向完全做到这一点的示例或教程的链接就足够了。可能是关于如何在随机森林中遍历决策树并存储可预测特定目标的节点的教程。
【问题讨论】:
标签: python machine-learning scikit-learn classification feature-selection