【问题标题】:Unbalanced labels - Better results in Confusion Matrix不平衡标签 - 混淆矩阵中的更好结果
【发布时间】:2023-03-24 08:10:01
【问题描述】:

我的标签不平衡。也就是说,在二元分类器中,我有更多的正面(1)数据和更少的负面(0)数据。我正在使用分层 K 折交叉验证并将真负数设为零。您能否让我知道我必须通过哪些选项来获得大于 tan 零的值以获得真底片?

【问题讨论】:

    标签: machine-learning


    【解决方案1】:

    处理不平衡类的策略有很多。

    首先,让我们了解(可能)发生了什么。您要求分类器最大限度地提高准确性:即正确分类的记录比例。例如,如果 85% 的记录属于 A 类,那么只需将所有内容标记为 A 类,您就可以获得 85% 的准确率。这似乎是分类器可以达到的最佳效果。

    那么,你该如何纠正呢?

    1) 您可以尝试在数据的平衡子集上训练您的模型。从多数类中随机抽取与少数类中相同的记录数。这将不允许您的分类器将所有内容标记为多数类。但这将以更少的信息来发现类边界的结构为代价。

    2) 使用与准确率不同的优化指标。流行的选择是AUCF1 Score

    3) 使用方法 1 创建一个分类器集合。每个分类器将看到数据的一个子集,并对一个类“投票”,可能带有一些置信度分数。这些分类器输出中的每一个都将是最终元分类器的一个特征(可能使用方法 2 构建)。通过这种方式,您可以访问所有可用信息。

    这远不是一个详尽的解决方案列表。使用不平衡(或“偏斜”)的数据集可能是一本完整的教科书。我建议阅读一些关于这个主题的论文。或许开始here

    【讨论】:

      猜你喜欢
      • 2020-01-22
      • 2020-08-30
      • 2020-07-31
      • 2018-11-06
      • 2023-01-12
      • 2020-05-30
      • 2021-11-11
      • 1970-01-01
      • 2020-02-28
      相关资源
      最近更新 更多