【发布时间】:2023-03-24 08:10:01
【问题描述】:
我的标签不平衡。也就是说,在二元分类器中,我有更多的正面(1)数据和更少的负面(0)数据。我正在使用分层 K 折交叉验证并将真负数设为零。您能否让我知道我必须通过哪些选项来获得大于 tan 零的值以获得真底片?
【问题讨论】:
标签: machine-learning
我的标签不平衡。也就是说,在二元分类器中,我有更多的正面(1)数据和更少的负面(0)数据。我正在使用分层 K 折交叉验证并将真负数设为零。您能否让我知道我必须通过哪些选项来获得大于 tan 零的值以获得真底片?
【问题讨论】:
标签: machine-learning
处理不平衡类的策略有很多。
首先,让我们了解(可能)发生了什么。您要求分类器最大限度地提高准确性:即正确分类的记录比例。例如,如果 85% 的记录属于 A 类,那么只需将所有内容标记为 A 类,您就可以获得 85% 的准确率。这似乎是分类器可以达到的最佳效果。
那么,你该如何纠正呢?
1) 您可以尝试在数据的平衡子集上训练您的模型。从多数类中随机抽取与少数类中相同的记录数。这将不允许您的分类器将所有内容标记为多数类。但这将以更少的信息来发现类边界的结构为代价。
2) 使用与准确率不同的优化指标。流行的选择是AUC 或F1 Score
3) 使用方法 1 创建一个分类器集合。每个分类器将看到数据的一个子集,并对一个类“投票”,可能带有一些置信度分数。这些分类器输出中的每一个都将是最终元分类器的一个特征(可能使用方法 2 构建)。通过这种方式,您可以访问所有可用信息。
这远不是一个详尽的解决方案列表。使用不平衡(或“偏斜”)的数据集可能是一本完整的教科书。我建议阅读一些关于这个主题的论文。或许开始here
【讨论】: