【问题标题】:Cross Validation in Classification分类中的交叉验证
【发布时间】:2016-03-10 14:48:33
【问题描述】:

我有两个不同的数据集,数据集 X 和数据集 Y...我从中计算用于分类的特征..

案例 1。当我将两者组合为一个大数据集然后使用 10 折交叉验证时,我得到了非常好的分类结果,准确度和 AUC > 95%

案例 2。然而,如果我使用其中一个数据集进行训练,另一个用于测试,结果会严重下降,准确度和 AUC 都变为 ~ 50%

我的问题是:

  1. 哪个案例的结果更可靠?

  2. 为什么结果会有巨大差异?

谢谢..

【问题讨论】:

  • 我回答你的问题了吗?您需要任何额外的帮助吗?

标签: image-processing classification cross-validation


【解决方案1】:

获取数据集的方式可能存在偏差,导致您得到最差的结果。

阅读this

另一件事是,在一种情况下,您正在使用较小的数据集训练分类器(假设它们的大小大致相同,即使使用 10 倍交叉验证,两者的组合更大)。这必然会导致性能下降。

所以我的答案是:

  1. 取决于您获得这两个数据集的方式以及最终分类器的使用方式。

  2. 训练集大小的差异偏差如何获得。

【讨论】:

    猜你喜欢
    • 2017-05-07
    • 2016-10-17
    • 2016-10-27
    • 2012-09-30
    • 1970-01-01
    • 2014-11-24
    • 2014-06-04
    • 2017-11-16
    • 2018-09-07
    相关资源
    最近更新 更多