【发布时间】:2018-01-18 15:45:10
【问题描述】:
R 中的 RandomForest 非常方便地接受输入 (X) 的因子。我假设这使得构建树变得更容易,如果从具有值 (a,b,c) 的因子变量中,您可以构建一个拆分为 (a,c) 和 (b) 的节点。在 sklearn 中,我需要将所有内容编码为虚拟对象 (0,1),以便丢失 a、b、c 向量之间的任何关系。
我的解释是否正确,sklearn 中有没有办法链接输入向量?
如果我将变量编码为 (0,1,2),我还假设 sklearn 会将其解释为 0 和 1 彼此接近,因此它会寻求(例如)拆分 [0,1]与 [2]。
【问题讨论】:
-
在给定树中选择的分割将基于对整个模型准确性的最大影响。可能是 0 和 1 对模型的影响有很大差异。
标签: python r machine-learning scikit-learn random-forest