【问题标题】:Training decision tree with biased data set使用有偏数据集训练决策树
【发布时间】:2016-08-09 00:09:24
【问题描述】:

我是数据挖掘的新手,我正在尝试训练决策树,但我选择的数据集非常有偏差,因此我得到的结果也有偏差。我在网上搜索过,我遇到了平衡的准确性。我对结果不满意。

如果我以平均比例的方式对数据集进行采样,例如YES 的 1000 个案例和 NO 的 1000 个案例,这会是一个好主意吗?

【问题讨论】:

  • 我不会重新采样数据集,而是在训练期间使用权重。

标签: machine-learning classification decision-tree


【解决方案1】:

您还可以在建模时给出权重。您可以为少数类分配更高的权重,它将补偿不平衡。

【讨论】:

    【解决方案2】:

    处理类不平衡的一种方法是对较大的类进行欠采样,以使类分布大约为一半。

    您的问题的答案是肯定的,前提是 1000 是较小类的大小,这样您丢失的较大类数据点就会更少。

    注意:在选择大类数据点时,尽量省略那些缺失值较多的数据点。

    【讨论】:

      猜你喜欢
      • 2015-06-27
      • 2012-06-02
      • 2018-07-07
      • 2019-06-01
      • 2016-08-15
      • 2021-04-09
      • 2016-05-24
      • 2019-04-27
      • 2015-07-30
      相关资源
      最近更新 更多