【问题标题】:dealing with the missing value when using C4.5 technique使用 C4.5 技术处理缺失值
【发布时间】:2015-07-03 22:34:32
【问题描述】:

我正在尝试使用一些分类技术构建分类器“模型”。从 C4.5 技术开始,面临缺失值的问题:

如何处理数据集中存在的缺失值?

我应该留在“吗?”在缺少的属性中?

【问题讨论】:

    标签: machine-learning classification decision-tree c4.5


    【解决方案1】:

    有几种处理缺失值的方法:

    1. 获取缺失数据:如果可能,尝试获取缺失值。
    2. 丢弃缺失数据:通过丢弃所有具有缺失值或特征的实例,减少可用于没有缺失值的数据集的数据。
    3. 插补:更好的策略是插补缺失值,即从数据的已知部分推断它们。一种常见的方法是使用缺失值所在的行或列的平均值、中位数或最频繁的值。建议使用多重插补。

    这可能会有所帮助:http://jmlr.csail.mit.edu/papers/volume8/saar-tsechansky07a/saar-tsechansky07a.pdf

    【讨论】:

      猜你喜欢
      • 2017-07-02
      • 1970-01-01
      • 1970-01-01
      • 2012-11-05
      • 2012-04-11
      • 1970-01-01
      • 1970-01-01
      • 2011-08-16
      • 1970-01-01
      相关资源
      最近更新 更多