【发布时间】:2016-01-03 22:37:54
【问题描述】:
如果我们知道特征的数量,我们如何找到随机森林的最大深度?
这是正则化随机森林分类器所必需的。
【问题讨论】:
-
为什么需要正则化随机森林分类器?你会如何规范化?有些人把这部分弄错了。完全成熟的发束不会过度拟合,因为装袋和随机特征选择可以防止这种情况。
-
当我使用 100% 的数据对其进行训练并使用相同的完整数据进行测试时,准确度为“1”。只有在过度拟合的情况下才有可能,所以我想用 max_depth 参数对其进行正则化,是的,它解决了问题,提高了准确性
-
嘿,您需要在交叉验证集上对其进行测试。显然,如果您在训练它的训练集上检查分类器,它将接近 100%。请把你的训练集分成两部分。训练和交叉验证以检查性能。还要检查特征之间的相关性,因为这些也可能导致过度拟合,但在我的拙见中,您的测试方法是错误的
-
特征之间的相关性对于随机森林来说通常不是问题。大多数随机森林包都带有袋外 (OOB) 交叉验证,您可以在训练期间免费获得。你用的是哪个包?
-
限制或修剪单棵树而不是森林。只有当您的数据超大时,您才能限制最大深度以加速。但是最好降低引导样本大小,因为您既可以加快速度又可以增加树的去相关性。
标签: machine-learning random-forest depth regularized