【发布时间】:2019-11-16 08:11:28
【问题描述】:
我有一个包含 200 多个分类变量(非序数)和几个连续变量的数据集。我曾尝试使用 one-hot 编码,但这会大大增加尺寸并导致得分不佳。
似乎常规的 scikit-learn 树只能与已转换为 one-hot 编码(对于非序数变量)的分类变量一起使用,我是如果有一种方法可以创建没有 one-hot 的树。我做了一些研究,发现有一个名为 h2o 的 API 可能有用,但我正在尝试找到一种在本地机器上运行它的方法。
【问题讨论】:
-
在什么框架下?请具体说明(为什么是
h2o标签?) -
我的错,请看我的编辑
-
好问题 - 我真的不喜欢 R,但看起来 R 中的 rpart() 特性处理分类变量比 Python 中优雅得多。例如在本文第1.2节kaggle.com/floser/…
标签: machine-learning data-science decision-tree h2o categorical-data