【发布时间】:2015-10-29 15:14:30
【问题描述】:
我正在研究 Weka 中的二元分类问题,该问题的数据集高度不平衡(一个类别占 90%,另一类别占 10%)。我首先将 SMOTE (http://www.cs.cmu.edu/afs/cs/project/jair/pub/volume16/chawla02a-html/node6.html) 应用于整个数据集以平衡类别,然后对新获得的数据进行 10 倍交叉验证。我发现(过度?)F1 的乐观结果约为 90%。
这是由于过采样造成的吗? 对应用了 SMOTE 的数据执行交叉验证是不好的做法吗? 有没有办法解决这个问题?
【问题讨论】:
标签: machine-learning weka text-classification