【问题标题】:When should Data Binning be used in data processing?什么时候应该在数据处理中使用 Data Binning?
【发布时间】:2021-04-04 21:43:48
【问题描述】:

在数据预处理中,数据分箱是一种将特征的连续值转换为分类值的技术。例如,有时,数据集中age 特征的值被替换为以下区间之一:

[10,20),
[20,30),
[30,40].

什么时候是使用数据分箱的最佳时间?它是否(总是)在预测系统中产生更好的结果,或者它可能作为试错法发挥作用?

【问题讨论】:

    标签: data-science data-mining data-processing binning feature-engineering


    【解决方案1】:

    主要是试错。当您将分箱应用于连续变量时,您会自动丢弃一些信息。许多算法更喜欢连续输入来进行预测,并且许多算法会自己对连续输入进行分类。如果您的连续变量有噪声,则应用分箱是明智的,这意味着您的变量的值没有非常准确地记录。然后,分箱可以减少这种噪音。有分箱策略,例如等宽分箱或等频分箱。当您的连续变量分布不均匀时,我建议避免等宽分箱。

    【讨论】:

    • 不管降噪如何,说Binning以一种好的/有用的方式降低了特征空间的复杂度是真的吗?也就是说,在一个维度上具有连续值的样本(在我们的示例中为age)将堆叠在特定的离散点上,那么,要么没有效果,要么效果好?
    • 嗯,除了降噪之外,我不能确定在特定离散点上堆叠会更好。我的意思是,如果您的年龄是连续的,您的算法可能会将所需的特征归因于介于两个分组年龄组之间的组,这意味着如果您要分类为“信誉好”或“坏”,那么输入 25 岁可能会有所贡献比 A 组(由 18-25 岁的人组成)对最终输出更有意义。
    猜你喜欢
    • 1970-01-01
    • 2010-09-28
    • 1970-01-01
    • 1970-01-01
    • 2011-09-03
    • 2011-01-11
    • 1970-01-01
    • 1970-01-01
    • 2023-04-02
    相关资源
    最近更新 更多