【发布时间】:2021-03-03 16:04:32
【问题描述】:
分类问题可能会在给定数据集中表现出严重的标签不平衡。这可以通过对某些类权重属性权重进行二次抽样来克服,这允许至少在模型训练期间平衡标签分布。另一方面,分层将允许保持一定的标签分布,该分布在每个相应的折叠中都保持不变。
对于回归问题,这是标准库,例如scikit-learn 未定义。覆盖stratification 的方法很少,Scott Lowe here 编写了一个写得很好的回归子采样理论方法。
我想知道为什么机器学习社区很少关注回归而不是分类问题的标签平衡?回归问题还表现出不同的特征,这些特征在数据收集设置中可能更容易/更难获得。那么,是否有任何框架或论文可以进一步解决这个问题?
【问题讨论】:
-
我投票结束这个问题,因为它与 help center 中定义的编程无关,而是关于 ML 理论和方法 - 请参阅 intro 和 NOTE
machine-learningtag info.
标签: machine-learning regression cross-validation