【问题标题】:What exactly does the `LocalImp` parameter do in randomForests package?randomForests 包中的 `LocalImp` 参数到底有什么作用?
【发布时间】:2019-12-18 00:06:54
【问题描述】:

谁能用相对简单的英语解释一下localImprandomForest包中的作用?

randomForest 文档将此参数描述为:

是否应该计算个案重要性度量? (将此设置为 TRUE 将覆盖重要性。)

它还声明它产生:

一个 p x n 矩阵,包含个案重要性度量,[i,j] 其中元素是第 i 个变量对第 j 个案例的重要性。 如果 localImp=FALSE 则为 NULL

有人可以准确解释这意味着什么,或者向我指出他们详细讨论此参数的论文的方向。

谢谢

【问题讨论】:

    标签: r random-forest


    【解决方案1】:

    randomForest 包或多或少是 Leo Breiman 和 Adel Cutler 编写的 fortran 代码的包装器。 Breiman 是加州大学伯克利分校的统计学教授,在他去世后他们保留了他的网站。

    这是一个了不起的资源:
    https://www.stat.berkeley.edu/~breiman/RandomForests/

    在这个网站上,他们在分类页面上提到了以下内容:

    对于每种情况,考虑它是 oob 的所有树。从未触及的 oob 数据中正确类别的投票百分比中减去变量 m 排列的 oob 数据中正确类别的投票百分比。这是本例中变量 m 的局部重要性分数。

    因此,对于观察 i,取所有没有在 i 上训练的树,因为它没有在引导程序中被选中。现在,考虑变量 m。置换不包含 i 的每棵树的左出 (oob) 观测值的 m 值。计算这些树的平均袋外精度。还要计算这些树的袋外精度,而不用置换变量 m 的值。从未排列的 oob 准确度中减去排列后的 m 准确度的平均值,得到 (i,m) 局部重要性度量。

    【讨论】:

      【解决方案2】:

      Localimp(局部重要性)设置每个变量在特定个体分类中的重要性(localImp=TRUE),这样您就可以看到每个特征对每一行输出的影响程度。

      您可以阅读: Understanding variable importances in forests of randomized trees

      还有 Random forest guide

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2010-12-31
        • 2017-11-11
        • 1970-01-01
        • 2021-10-30
        • 2022-11-29
        • 1970-01-01
        • 2017-07-26
        • 2011-04-18
        相关资源
        最近更新 更多