【问题标题】:crossvalidation “balancing” for regression problems [closed]回归问题的交叉验证“平衡”[关闭]
【发布时间】:2021-03-03 16:04:32
【问题描述】:

分类问题可能会在给定数据集中表现出严重的标签不平衡。这可以通过对某些类权重属性权重进行二次抽样来克服,这允许至少在模型训练期间平衡标签分布。另一方面,分层将允许保持一定的标签分布,该分布在每个相应的折叠中都保持不变。

对于回归问题,这是标准库,例如scikit-learn 未定义。覆盖stratification 的方法很少,Scott Lowe here 编写了一个写得很好的回归子采样理论方法。

我想知道为什么机器学习社区很少关注回归而不是分类问题的标签平衡?回归问题还表现出不同的特征,这些特征在数据收集设置中可能更容易/更难获得。那么,是否有任何框架或论文可以进一步解决这个问题?

【问题讨论】:

  • 我投票结束这个问题,因为它与 help center 中定义的编程无关,而是关于 ML 理论和方法 - 请参阅 intro 和 NOTE machine-learningtag info.

标签: machine-learning regression cross-validation


【解决方案1】:

问题的复杂性在于回归的连续性。当你有分类的时候,把它们分成类是很自然的,因为它们基本上已经被分成类了:) 现在,如果你有一个回归,分裂的可能性基本上是无限的,最重要的是,这是不可能的知道什么是好的分裂。正如您发送的文章中一样,您可能会应用排序或分数方法,但最终,您不知道它们在多大程度上是正确的。您也可以将其拆分为间隔。这就是堆栈库所做的。在文档中,它说:“对于连续目标变量 overstock 使用分箱和基于箱的分类拆分”。他们所做的是,他们首先将连续值分配给箱(类),然后对其应用分层。

这方面的研究并不多,因为你能想出的一切都是启发式的。但是,如果您可以结合一些领域知识,则可能会有例外。例如,假设您正试图从一组特征中预测某些电磁波的频率。在这种情况下,您对波频率是如何分割的有先验知识。 (https://en.wikipedia.org/wiki/Electromagnetic_spectrum)所以现在很自然地将它们分成相对于它们的波长的连续间隔并进行回归分层。但除此之外,很难得出可以概括的东西。

我个人从未遇到过这方面的研究。

【讨论】:

    猜你喜欢
    • 2021-10-08
    • 2018-07-26
    • 2016-09-30
    • 2016-06-27
    • 2017-11-12
    • 1970-01-01
    • 2017-08-27
    • 2021-05-27
    • 1970-01-01
    相关资源
    最近更新 更多