【问题标题】:Random Forest - Max Features随机森林 - 最大特征
【发布时间】:2020-05-16 05:47:33
【问题描述】:

我确实有一个问题,我需要您的支持。我有一个正在分析的数据集。我需要预测一个目标。为此,我做了一些数据清理,其中包括高度下降(线性相关特征)

准备好数据后,我应用了随机森林回归器(这是一个回归问题)。我有点卡住了,因为我真的无法理解 ma​​x_features

的含义和价值

我找到了以下页面answer,写的地方

features=n_features 用于回归是 scikit 的一个错误。 RF 的原始论文给出了 max_features = n_features/3 用于回归

如果我使用 max_features=sqrt(n) 或 max_features=n_features,我会得到不同的结果

谁能给我一个很好的解释如何处理这个参数?

那就太好了

【问题讨论】:

    标签: machine-learning scikit-learn random-forest


    【解决方案1】:

    max_features是需要调整的参数。 sqrtn/3 等值是默认值,通常表现不错,但需要针对每个数据集优化参数,因为它取决于您拥有的特征、它们的相关性和重要性。

    因此,我建议使用max_features的网格培训模型,从而尝试每个可能的值2到功能的总数。
    oob_score=True 987654326 @和使用oob_score_评估森林的性能。一旦你循环超过所有可能的值max_features,请保持获得最高oob_score的那个。

    为了安全起见,请将n_estimators 保持在高端。

    PS:此过程基本上是一个参数的网格搜索优化,通常通过交叉验证完成。由于RFS给您OOB分数,您可以使用这些而不是CV分数,因为它们更快地计算。

    【讨论】:

      猜你喜欢
      • 2019-02-16
      • 2015-09-28
      • 2021-05-09
      • 1970-01-01
      • 2017-07-19
      • 2021-08-29
      • 2018-12-01
      • 2014-04-17
      • 2018-06-17
      相关资源
      最近更新 更多