【发布时间】:2020-05-19 23:26:46
【问题描述】:
我使用 onehotencoder 将所有分类自变量从字符串转换为数字(二进制 1 和 0),但是当我运行决策树时,算法将二进制分类变量视为连续变量。
例如如果性别是我的自变量之一,则将男性转换为 1,将女性转换为 0。当我在决策树中使用它时,节点在 0.5 处分裂,这是没有意义的。
如何将此数字连续转换为数字分类?
【问题讨论】:
-
one hot encode 使用
sklearn.preprocessing.OneHotEncoder或pandas.get_dummies的所有分类变量 -
做到了,但它仍然被认为是连续的而不是分类的,因为节点在 0.5 处分裂。如何解释这个 0.5?在 R 中,节点分裂为 1 或 0。我们是否也可以在 sklearn 中获得类似的输出
标签: python scikit-learn decision-tree