【问题标题】:random forest regression output calculation随机森林回归输出计算
【发布时间】:2019-04-20 05:28:21
【问题描述】:

您好,这是一个纯理论问题,我无法理解(并且可能完全错误)

使用随机森林回归 - 您种植 n 棵树,每棵树使用数据的子集,在某些情况下使用可用变量的子集来预测因变量。取这 n 棵树的平均值来给我们一个预测值。但是,是否需要查看单个树级别的预测分布?我们是否能够获得一个可以确定总体预测值的数字?我会假设在单个树级别生成更一致的数字会比各种各样的数字更受欢迎?

提前致谢

【问题讨论】:

    标签: r random-forest


    【解决方案1】:

    这种确定变量重要性的方法有一些缺点。对于包含具有不同级别数的分类变量的数据,随机森林偏向于具有更多级别的属性。可以使用部分排列和生长无偏树等方法来解决这个问题。如果数据包含与输出具有相似相关性的相关特征组,则较小的组优于较大的组。

    【讨论】:

    • 感谢您的回复。我更多地关注森林中每棵树的输出分布。对于每棵树的预测,我应该查看任何价值/模式吗?
    猜你喜欢
    • 2019-12-06
    • 2019-08-08
    • 2016-02-21
    • 2023-03-14
    • 2021-10-31
    • 2018-10-31
    • 2012-07-22
    • 2018-06-24
    • 2016-04-24
    相关资源
    最近更新 更多