【发布时间】:2021-04-04 21:43:48
【问题描述】:
在数据预处理中,数据分箱是一种将特征的连续值转换为分类值的技术。例如,有时,数据集中age 特征的值被替换为以下区间之一:
[10,20),
[20,30),
[30,40].
什么时候是使用数据分箱的最佳时间?它是否(总是)在预测系统中产生更好的结果,或者它可能作为试错法发挥作用?
【问题讨论】:
标签: data-science data-mining data-processing binning feature-engineering