【发布时间】:2016-05-24 09:32:55
【问题描述】:
我有以下训练数据集,其中第一行显示属性名称。
S_Length, Se_Width, P_Length, P_Width, Predicate
5.1,3.5,1.4,0.2,Ili
4.9,3.0,1.4,0.2,Iri
4.7,3.2,1.3,0.2,Iyr
4.6,3.1,1.5,0.2,Ir
5.0,3.6,1.4,0.2,Po
5.4,3.9,1.7,0.4,II
4.6,3.1,1.5,0.2,Ir
5.0,3.4,1.5,0.2,Imt
4.6,3.1,1.5,0.2,Ir
在上述数据集中,在第 4,7 和 9 行,数据集是重复的。它如何影响算法?我应该省略重复的数据吗?
【问题讨论】:
-
如果我试图根据包括他们喝的啤酒在内的属性来预测某人是否是彩票中奖者,然后我包括一个中奖的 Bud 饮酒者的无数个副本,你认为会是什么?发生了吗?
-
这是一个非常现实的例子。那么可以肯定的是,重复的数据集给节点增加了不必要的权重,应该删除吗?
标签: machine-learning decision-tree training-data