【问题标题】:Handling imbalanced data in Machine Learning?在机器学习中处理不平衡的数据?
【发布时间】:2019-03-18 05:13:10
【问题描述】:

在数据中,如果目标特征不平衡,说 2% 好到 98% 坏,说 2% 是 500 条记录,如果我使用这 500 条坏记录加上 98% 中的 500 条好记录并训练机器学习中的模型。

我的问题是模型能否很好地概括 500 + 500 个数据,因为它是 50:50 的好与坏?我会选择基于多次迭代的 500 条记录来获得高精度,因为只有 1000 条记录会在机器中运行得更快以获得输出。

【问题讨论】:

标签: machine-learning data-science data-analysis


【解决方案1】:

[https://machinelearningmastery.com/tactics-to-combat-imbalanced-classes-in-your-machine-learning-dataset/][1]

你好,

希望以上参考链接能清除您的概念。

在处理不平衡数据的情况下,仅检查一种可能性是不好的方法,您必须尝试不同的方法,例如收集更多数据、创建数据、更改精度测量(roc 曲线或不同类型的矩阵)或对输入进行采样数据。

【讨论】:

  • 所有模型在 50:50 平衡下都能很好地概括,我的问题是上述工作是否有效?
  • 它会起作用,这取决于特征之间的关系。
猜你喜欢
  • 2017-03-26
  • 2018-12-14
  • 2017-09-19
  • 2016-02-22
  • 2018-03-02
  • 2018-08-18
  • 1970-01-01
  • 2020-01-11
  • 2016-09-19
相关资源
最近更新 更多