【发布时间】:2020-12-05 07:15:01
【问题描述】:
据我们所知,不平衡的样本会导致问题和更多的努力。
当我处理这个问题时,我对定义感到困惑。比如说,我有一个包含 200 只猫、200 只狗和 400 块石头的训练数据集。 当我要对数据集进行分类时,在分类 3 类时,我应该有 200 只猫、200 只狗和 200 块石头,当我只分类 2 类宠物和石头时,我应该分配什么?
我还应该选择400 pets(带 200 只猫和 200 只狗)和400 stones 吗?使类宠物和石头的数量相同。
还是我应该选择400 pets(带 200 只猫和 200 只狗)和200 stones?或者让所有内部类都有相同的概率被观看,毕竟猫和狗本质上是不同的。
【问题讨论】:
标签: machine-learning imbalanced-data