【发布时间】:2017-10-29 21:27:14
【问题描述】:
我有一个二元分类问题,其中一个类代表了所有观察的 99.1% (210 000)。作为处理不平衡数据的策略,我选择了抽样技术。但我不知道该怎么做:对我的多数班级进行欠采样或对代表性较低的班级进行过采样。 有人给点建议吗?
谢谢。
附: 我使用 sklearn 的随机森林算法。
【问题讨论】:
-
如果 210000 个观测值中的 0.9% 足以拟合,则对主要类进行欠采样。如果不是,则对代表性较少的类进行过采样。或者当然你可以两者都做。
标签: python machine-learning classification random-forest supervised-learning