【问题标题】:How to do feature selection with randomForest package?如何使用 randomForest 包进行特征选择?
【发布时间】:2012-07-09 20:54:56
【问题描述】:

我正在使用 randomForest 来找出最重要的变量。我期待一些输出定义模型的准确性,并根据变量的重要性对变量进行排名。但我现在有点困惑。我尝试了 randomForest,然后运行importance() 来提取变量的重要性。 但后来我看到了另一个命令rfcv(用于特征选择的随机森林交叉验证),我想这应该是最适合这个目的的,但我对此的问题是:如何获取最重要的列表变量?运行后如何查看输出?使用哪个命令?

另外一件事:randomForest 和 predict.randomForest 有什么区别?

我对随机森林和 R 不是很熟悉,因此我们将不胜感激。

提前谢谢你!

【问题讨论】:

    标签: r random-forest feature-selection


    【解决方案1】:

    创建randomForest 模型后,您可以使用predict.randomForest 来使用您在新数据上创建的模型,例如使用训练数据构建一个随机森林,然后使用 predict.randomForest 通过该模型运行您的验证数据。

    至于 rfcv 有一个选项 recursive (来自帮助):

    变量的每一步是否(重新)评估变量的重要性 减少

    一切尽在help file

    【讨论】:

    • 不,它不在帮助文件中。 rfcv(... recursive=T) 选项在任何时候都不会真正告诉您各个变量的重要性。所以它对特征选择完全没用! rfcv 唯一做的就是将 CV 误差估计为 n.var 的函数,变量的数量;这几乎没用。至于使用原始特征重要性进行变量选择,这充满了陷阱,尤其是。具有高度相关的变量。所以不要依赖任何一个来进行特征选择。使用其他软件包之一。
    猜你喜欢
    • 2012-09-29
    • 2017-08-17
    • 2020-06-19
    • 2014-11-15
    • 2020-09-11
    • 2017-06-13
    • 2015-02-11
    • 2018-05-23
    • 2013-08-15
    相关资源
    最近更新 更多