【发布时间】:2015-12-16 17:30:43
【问题描述】:
随机森林接受数字数据。通常带有文本数据的特征被转换为数字类别,并且连续的数字数据被输入,因为它没有离散化。 RF如何处理创建节点的连续数据?它会在内部对连续的数值数据进行分类吗?或将每个数据视为离散级别。
例如: 我想向 RF 提供一个数据集(当然是在对文本特征进行分类之后)。 RF如何处理连续数据? 是否建议在喂食之前离散化连续数据(在这种情况下为经度和纬度)?还是这样做信息丢失了?
【问题讨论】:
标签: scikit-learn random-forest discretization