【问题标题】:Is the result produced after SMOTE reliable?SMOTE后产生的结果可靠吗?
【发布时间】:2015-05-11 13:33:48
【问题描述】:

我有一个倾斜的数据集,其中包含 twitter 推文和与之相关的情绪。正面:负面情绪的比率约为 1:4(训练集)。当我在 Weka(没有 SOMTE)上运行训练集时,结果并不令人满意。所以我使用 SMOTE 来平衡课程。之后我得到的结果要好得多。 我使用 Libsvm 进行分类。

这种 SMOTE 技术生成的模型的可靠性如何? 对于这种不平衡的数据集,我们可以一直使用 SMOTE 吗? 我是 ML 和 weka 的新手,所以对这些东西了解不多。

【问题讨论】:

    标签: machine-learning weka


    【解决方案1】:

    这取决于。过采样和欠采样有很多优点和缺点,无论是随机的还是合成的。应通过比较训练和交叉验证或测试错误来检查结果。还可以通过在 y 轴上绘制错误率和在 x 轴上绘制数据大小来绘制学习曲线。这样可以检测到过于乐观的结果、泛化能力等。有时我们可以因为过度拟合而获得好分数。我使用了 SMOTE 并取得了不错的效果。但后来我不得不检查我提到的流程,看看有多好。对于类不平衡问题,您可能会尝试的另一件事是保持数据集不变,然后应用成本敏感的学习器,该学习器将根据某些权重对 FP 和 FN 进行惩罚。您也可以在不平衡数据集上应用常规算法,然后应用成本敏感评估,如成本曲线。如果给定一个 50-50 的平衡数据集,这条曲线可以告诉您的模型将如何执行。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-11-15
      • 2014-08-19
      • 1970-01-01
      • 1970-01-01
      • 2021-03-05
      • 2016-04-23
      • 1970-01-01
      • 2013-01-14
      相关资源
      最近更新 更多