【发布时间】:2020-10-31 14:16:18
【问题描述】:
我正在尝试调整我的随机森林分类器。当我使用GridSearchCV时,最好的参数是min_samples_split = 2、min_samples_leaf = 4、max_depth = None,我认为这绝对是过拟合。所以我为训练和测试数据绘制了 auc:
图表显示,随着我们增加max_depth,train_auc 和 test_auc 都会增加;那张图有意义吗?因为我认为随着深度的增加,测试数据的性能实际上会下降。
【问题讨论】:
-
也许这个medium.com/all-things-ai/… 可以帮助你的图表变得有意义,当训练数据和测试数据的分数开始分裂时,你可以提前停止模型并选择好的max_depth,在你的情况下可以是@987654329 @
-
Hi@mjrezaee,但是测试集上更高的 AUC 不是意味着模型的性能更好吗?我应该只是一个没有过度拟合但 AUC 较低的模型,还是一个过度拟合但在测试集上具有较高 AUC 的模型?
-
RandomForestClassifiertrains with Accuracy score,最好用这个分数来衡量提前停止点。当 Train Accuracy error (1-accuracy_score) 不断降低但 Test accuracy error 开始增加时,您可能会更清楚地看到分割点。虽然您可以在 AUC 图中看到,训练分数不断增加,而您的测试分数几乎是即时的,0.15 被认为是 AUC 测量的显着差异 -
@mjrezaee,
RandomForestClassifier训练尽量减少对数损失,而不是准确度。
标签: python machine-learning scikit-learn random-forest