【问题标题】:XGBoost (Gradient Boosting) vs Random ForestXGBoost(梯度提升)与随机森林
【发布时间】:2017-03-01 21:44:53
【问题描述】:

(希望这是一个适合此类问题的论坛,如果不是,请提出建议。)

XGBoost 库中梯度提升与随机森林相比的性能如何?有没有比较两者的基准数字?

我即将开始对数据集(至少 6GB,最高 TB)中的数百万个事件进行分类和回归。

谢谢

【问题讨论】:

  • 算法性能可能取决于数据,为了获得最好的结果,您可能会尝试两者。但是,我相信 XGBoost 可以被修改成随机森林。以我的经验,随机森林的实现不如 XGBoosts 快,考虑到数据大小,这可能是您关心的问题。
  • cran.r-project.org/web/packages/xgboost/vignettes/… 提到如何调整 XGBoost 以充当 RF。

标签: random-forest decision-tree gradient-descent xgboost gbm


【解决方案1】:

您可以将数据下采样到几 MB(对于数千个功能来说还可以)并检查两种算法的性能。

尽管如此,XGBoost 对于大数据会更有效,因为已经努力将目标损失函数减少到两个导数。您可能会遇到大数据射频问题。例如,尝试在 R 中使用大数据运行 RF,您很快就会意识到 RF 在处理大数据时并不是最好的。

【讨论】:

    猜你喜欢
    • 2018-02-21
    • 2019-05-08
    • 2015-03-07
    • 1970-01-01
    • 2020-09-25
    • 2016-04-24
    • 2017-03-15
    • 2020-11-30
    • 2021-07-09
    相关资源
    最近更新 更多