【问题标题】:Decision Tree. Strategy for noise决策树。噪音策略
【发布时间】:2012-10-31 17:05:10
【问题描述】:

在决策树中对抗噪声的好策略是什么?

在我的训练数据中,

我有两条属性相同但分类不同的记录。

  1. 女,奢华,LV,是的
  2. 女,奢华,LV,No

根据我的阅读,它说返回这两条记录的复数分类。

但是当我想进行预测时,这会引发一个问题,因为我的预测的输出应该是是或否。

所以,试着找出在这种情况下我可以使用哪些策略来预测。

谢谢。

【问题讨论】:

  • 替代方案:1. 消除此类矛盾,2. 添加更多用于决策的属性,即 Female, Luxury, LV 应辅以额外的消歧功能,带来 2 个不同的选择器 - 一个用于 yes,以及一个为no。 3. 你能负担得起一种模糊方法,即将概率存储为决策而不是具体的yesno
  • 修剪处理非类属性中的噪声,叶子中的概率处理模糊类。
  • @Stan。这是一项作业,所以我真的不能说问题设置得有多糟糕。谢谢!
  • 然而,即使在分配中,您也可以检测到通常应该被视为不一致的数据,并决定/建议跳过它。至少,这是一种现实世界的方法。

标签: artificial-intelligence data-mining decision-tree


【解决方案1】:

当类别预测未定时:

  1. 最简单(也是常见)的方法是预测多数类别
  2. 获取更多信息。例如,包括其他属性(如果可用)或获取更多训练样本(如果可用)。
  3. 删除一些信息。目的是在尽可能多地保留预测信息的同时消除尽可能多的噪声源。通常它是通过删除无用的属性来完成的。在树的情况下,可以通过修剪来完成。最终,您可以删除异常值(例如错误测量的样本),但您必须知道哪个样本是异常值。

【讨论】:

    猜你喜欢
    • 2020-04-15
    • 1970-01-01
    • 2012-08-20
    • 2015-02-06
    • 2013-08-29
    • 2018-05-04
    • 2017-04-30
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多