【发布时间】:2020-04-07 01:17:40
【问题描述】:
我被要求实现一个随机森林分类器,据我了解,它只是一堆决策树,在训练后运行测试数据,然后通过所有树的多数投票确定分类。
这一切都很好,我什至明白熵决定了接下来要使用哪个特征。我很难理解的是,对于数字数据,我如何确定条件?
例如,一个人是否会根据天气条件打高尔夫球。给定 3 个特征(前景、湿度、风)和分类标签(播放 -> 是或否),我们首先从前景开始:
展望 -> 阴(纯)、晴、雨
从 Sunny 中,选择 Humidity 下一个:High、Normal(纯)
从 Outlook 到 Rain,选择 Wind(最后一个特征):弱(纯)、强
本质上,在这种情况下,特征的值是单独获取的。但是,当我有一个包含一堆小数的数据集时会发生什么?
(部分)数据:
在这种情况下,我会首先查看标签(0 或 1),然后再查看每个标签中熵最高的特征。但是我怎么知道去叶子节点的条件呢?甚至,父母有几个孩子? 一个糟糕的图表来帮助我的问题:
【问题讨论】:
标签: python machine-learning random-forest decision-tree