【问题标题】:Prediction for classification yields wrong result scikit learn分类预测产生错误的结果 scikit learn
【发布时间】:2017-12-22 14:02:48
【问题描述】:

我已从数据集生成模型,并尝试根据 cohen_kappa 分数和预测准确度找到最佳算法。我针对各种算法运行它,因为我将获得的数据类型是未知的,因此通过比较它们的 kappa 和准确性来找到最佳算法。 我的数据经过 10 次交叉验证。

我在随机森林、决策树、SGDClassifier、感知器、被动攻击、逻辑回归、梯度提升、朴素贝叶斯、KNeighbors 之间进行了比较。

对于我的示例,我将随机森林作为 Kappa=1 且准确度=0.94 的最佳分类算法

我的分类是 2 类分类,条件如 ResponseTime > 200。

现在,当我尝试运行预测时,对于某些因变量值,我得到了正确的预测,但对于某些完全错误的预测。

我尝试了所有不同的算法,但预测结果非常不一致。

谢谢

【问题讨论】:

  • 你能上传你的数据吗?
  • 附上我的一个样本数据。但是这个对于随机森林的 kappa=0,精度为 0.97。
  • 抱歉,在完成我的回复之前按回车键。附上我拥有的样本数据之一。但是这个对于随机森林的 kappa=0,精度为 0.97。附加我用来生成模型的示例数据文件。我正在尝试重新生成 kappa 值为 1 的数据集。使用此数据集,我得到一个数据集输入的正确预测值,但不同输入的预测错误。附加所有 3 个 arff 文件。
  • 上传文件和共享时遇到问题..给我一些时间

标签: scikit-learn


【解决方案1】:

您必须仔细查看错误预测的特征值。可能是您的数据集中有相互矛盾的数据。例如,如果你有这样的观察和标签,无论你多么努力,你如何交叉验证或堆叠你的算法,你永远不会获得 100% 的准确率。 75% 的准确率是这里的最高分。

0 => 0
0 => 0
0 => 0
0 => 1 <- this sample have wrong label
1 => 1
1 => 1
1 => 1
1 => 0 <- this sample have wrong label

【讨论】:

    猜你喜欢
    • 2014-07-29
    • 2015-03-01
    • 2012-09-03
    • 2021-01-11
    • 2015-01-12
    • 2022-11-25
    • 2016-10-29
    • 2016-05-25
    • 2018-01-31
    相关资源
    最近更新 更多