【问题标题】:the definition of unbalanced sample [closed]不平衡样本的定义
【发布时间】:2020-12-05 07:15:01
【问题描述】:

据我们所知,不平衡的样本会导致问题和更多的努力。

当我处理这个问题时,我对定义感到困惑。比如说,我有一个包含 200 只猫、200 只狗和 400 块石头的训练数据集。 当我要对数据集进行分类时,在分类 3 类时,我应该有 200 只猫、200 只狗和 200 块石头,当我只分类 2 类宠物和石头时,我应该分配什么?

我还应该选择400 pets(带 200 只猫和 200 只狗)和400 stones 吗?使类宠物和石头的数量相同。

还是我应该选择400 pets(带 200 只猫和 200 只狗)和200 stones?或者让所有内部类都有相同的概率被观看,毕竟猫和狗本质上是不同的。

【问题讨论】:

    标签: machine-learning imbalanced-data


    【解决方案1】:

    我认为这取决于任务,如果您要将样本分为两类(宠物和石头),那么您必须使用所有 400 个宠物图像(猫和狗)和 400 个石头样本。但是,如果您有三个类别:猫、狗和石头;那么你需要将每个训练 epoch 的石头样本数量限制为 200 个。

    为什么会这样? 在宠物与石头两类的情况下:两个标签(宠物和石头)在每个时期更新模型的权重 400 次。因此,训练完成后,模型将能够等效地识别这两个类。

    在三个类(猫、狗和石头)的情况下,猫和狗类每个时期更新权重 200 次,而石头类每个时期更新权重 400 次,因此模型将有更高的机会输出石头类比输出猫狗类。

    因此,总而言之,您应该使所有类别的样本数量相同。

    PS:如果您在三个类别的情况下从 400 个石头样本中随机选择 200 个样本,那么与其他两个类别相比,您的模型最终不会偏向于石头类别,但它会更好地概括在石头上与其他两个类相比,因为它看到了更多此类的独特样本。

    【讨论】:

    • 谢谢,@SELLAM,我正在考虑对您的建议进行实验,以检查如果在一个类下提供更多样本,概率是否会更高。就目前而言,你所说的很有说服力。猜猜这就是我们需要平衡样本的原因。
    猜你喜欢
    • 1970-01-01
    • 2018-07-26
    • 1970-01-01
    • 2013-01-29
    • 2017-07-27
    • 2013-12-29
    • 2019-08-15
    • 2019-07-18
    • 2019-11-20
    相关资源
    最近更新 更多