【问题标题】:Titanic Dataset overfitting: can it be that much?泰坦尼克号数据集过度拟合:能有那么多吗?
【发布时间】:2021-03-23 14:02:36
【问题描述】:

我有点困惑,因为我正在训练一个模型,该模型在训练数据上产生大约 88% 的 CV 分数,而同一模型在我提交后在测试数据上表现不佳(分数为 0.75)。 准确率下降 12 分不可能都是由于过度拟合,不是吗? 有任何想法吗?您是否在模型/提交中遇到过这样的差距?

请参阅随附的图片了解模型和结果。

############################################## ###########

xgb_clf = XGBClassifier(n_estimators=87, learning_rate=0.05,max_depth = 10,
colsample_bytree =0.8 , n_jobs=-1 , random_state = 7,
scale_pos_weight = 0.6, min_child_weight = 0.9, gamma = 2.1)
skf = RepeatedStratifiedKFold(n_splits = 4)

results= cross_val_score(xgb_clf , X_train , y , cv =skf, scoring='roc_auc')
print("Accuracy: %.2f%% (%.2f%%)" % (results.mean()100, results.std()100))

准确度:88.13% (2.47%)

【问题讨论】:

  • 您好,欢迎来到本网站。这个问题似乎不是关于编程,而是更多关于机器学习概念。将来,您可能会考虑在 CrossValidated (stats.stackexchange.com) 上提出此类问题

标签: python xgbclassifier overfitting-underfitting


【解决方案1】:

是的,这绝对可以表示过度拟合。训练准确率和测试准确率之间 12% 的差异并不罕见。事实上,在过度拟合的极端情况下,您甚至可能会观察到训练集的 100% 准确率和测试数据的机会级别的准确率。

【讨论】:

    猜你喜欢
    • 2019-03-01
    • 1970-01-01
    • 2021-07-29
    • 2022-07-25
    • 2017-06-27
    • 2016-06-19
    • 2022-01-03
    • 2020-10-25
    • 2017-03-08
    相关资源
    最近更新 更多