【发布时间】:2012-10-31 17:05:10
【问题描述】:
在决策树中对抗噪声的好策略是什么?
在我的训练数据中,
我有两条属性相同但分类不同的记录。
- 女,奢华,LV,是的
- 女,奢华,LV,No
根据我的阅读,它说返回这两条记录的复数分类。
但是当我想进行预测时,这会引发一个问题,因为我的预测的输出应该是是或否。
所以,试着找出在这种情况下我可以使用哪些策略来预测。
谢谢。
【问题讨论】:
-
替代方案:1. 消除此类矛盾,2. 添加更多用于决策的属性,即
Female, Luxury, LV应辅以额外的消歧功能,带来 2 个不同的选择器 - 一个用于yes,以及一个为no。 3. 你能负担得起一种模糊方法,即将概率存储为决策而不是具体的yes或no? -
修剪处理非类属性中的噪声,叶子中的概率处理模糊类。
-
@Stan。这是一项作业,所以我真的不能说问题设置得有多糟糕。谢谢!
-
然而,即使在分配中,您也可以检测到通常应该被视为不一致的数据,并决定/建议跳过它。至少,这是一种现实世界的方法。
标签: artificial-intelligence data-mining decision-tree