【问题标题】:Why Up sampling over down sampling? [closed]为什么上采样而不是下采样? [关闭]
【发布时间】:2020-08-25 23:56:40
【问题描述】:

我有 191 个样本的数据并创建了逻辑回归。我首先使用原始数据运行模型,然后进行上采样。 我无法理解的是:-

  1. 为什么要在降采样之前进行升采样,或者同时进行升采样和降采样。
  2. 如果上采样造成过拟合问题,则可以通过缩放数据来处理。
  3. 在上采样或任何其他采样之后,我必须查看哪些参数才能继续进行另一次采样,例如下采样还是上下采样?

我恳请有人帮助我理解上述内容。

【问题讨论】:

  • 不是编程问题,因此这里可以说是题外话;更适合Cross Validated

标签: machine-learning statistics logistic-regression


【解决方案1】:
  1. 下采样总是意味着信息的丢失,这就是为什么通常最好避免下采样的原因。
  2. 缩放实际上是最好的选择。通常,数据会被上采样,因为与多数数据相比,它在数据中的代表性不足。由于许多算法试图最小化经验风险 - 错误分类的概率 - 他们更多地关注多数数据。上采样/下采样的原因是因为训练数据中的表示不具有代表性,或者少数数据的错误分类成本要高得多,例如在预测性维护中。纠正这个问题的最佳方法实际上是成本矩阵。然而,由于相当多的算法没有现成的成本函数机制,因此上采样/下采样通常用作近似值。因此,只有在采样过程中可以引入额外的“噪声”时,才会首选上采样
  3. 标准验证

【讨论】:

  • 标准验证是指查看混淆矩阵、ROC 曲线和 AUC 吗?
  • 确实如此。您还可以查看数据本身的方差,但这更有助于优化训练时间
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2023-04-06
  • 2015-12-27
  • 1970-01-01
  • 2021-08-20
  • 1970-01-01
相关资源
最近更新 更多