【发布时间】:2019-04-20 05:28:21
【问题描述】:
您好,这是一个纯理论问题,我无法理解(并且可能完全错误)
使用随机森林回归 - 您种植 n 棵树,每棵树使用数据的子集,在某些情况下使用可用变量的子集来预测因变量。取这 n 棵树的平均值来给我们一个预测值。但是,是否需要查看单个树级别的预测分布?我们是否能够获得一个可以确定总体预测值的数字?我会假设在单个树级别生成更一致的数字会比各种各样的数字更受欢迎?
提前致谢
【问题讨论】:
标签: r random-forest
您好,这是一个纯理论问题,我无法理解(并且可能完全错误)
使用随机森林回归 - 您种植 n 棵树,每棵树使用数据的子集,在某些情况下使用可用变量的子集来预测因变量。取这 n 棵树的平均值来给我们一个预测值。但是,是否需要查看单个树级别的预测分布?我们是否能够获得一个可以确定总体预测值的数字?我会假设在单个树级别生成更一致的数字会比各种各样的数字更受欢迎?
提前致谢
【问题讨论】:
标签: r random-forest
这种确定变量重要性的方法有一些缺点。对于包含具有不同级别数的分类变量的数据,随机森林偏向于具有更多级别的属性。可以使用部分排列和生长无偏树等方法来解决这个问题。如果数据包含与输出具有相似相关性的相关特征组,则较小的组优于较大的组。
【讨论】: