【发布时间】:2015-09-12 04:06:51
【问题描述】:
按照我的理解,在创建随机森林时,该算法将一堆随机生成的决策树捆绑在一起,对它们进行加权以使其适合训练数据。
可以说可以将森林的平均值简化为简单的决策树吗?而且,如果是这样 - 我如何访问和展示这棵树?
我在这里要做的是提取树中的信息,以帮助识别主要属性、它们的边界值和在树中的位置。我假设这样的树将为人类(或计算机启发式)提供关于数据集中哪些属性为确定目标结果提供最深入了解的洞察力。
这似乎是一个幼稚的问题 - 如果是这样,请耐心等待,我是新手,想达到一个我充分理解它的阶段。
【问题讨论】:
-
如果你想发现哪个特征是最重要的,那么也许你只需要查看 RandomForest 对象的feature_importances_ 属性。问题是 randomForest 是为了解决决策树精度的问题。随机方面会倾向于消除错误......不知道恢复到独特的树是否明智。也许其他人对此有更多线索
-
感谢 RPresle - 是的,这有助于确定每个属性的相对重要性 - 但缺少的部分是我假设/想象平均决策树可能有效使用的边界条件 - 然后再说一次,正如您所说,我认为平均边界条件不一定是正确的。显示属性“num_mcflurrys”是否被确定为对确定结果“超重”很重要仍然可能是有益的,可能有一些方法可以找出有多少“num_mcflurrys”可能被认为是有意义的边界?
标签: scikit-learn random-forest