【问题标题】:Do 10 random forests with 50 trees each on same data, equal one random forest on same data with 500 trees?10 个随机森林,每个森林有 50 棵树,每个树都在相同的数据上,是否等于一个随机森林在相同的数据上,有 500 棵树?
【发布时间】:2019-11-16 05:46:48
【问题描述】:

我有一个包含 100 万行的数据集。

在运行 1 个包含 500 棵树的随机生存森林时,使用 R 中的 randomForestSRC 包,由于内存问题,需要花费大量时间。

那么,我是否可以在相同的数据上运行 10 个随机生存森林,其中包含 50 棵树,每次使用不同的种子,并平均 10 个随机森林的结果(除以 10),这样我就可以获得相当相似的结果结果是有 500 棵树的那棵?

【问题讨论】:

  • 您可以这样做,但是您必须对所有模型中的所有树进行平均才能获得相似的结果。分别平均每个模型是不同的。

标签: random-forest


【解决方案1】:

是的,结果应该相似。随机森林只是决策树的集合。以后添加更多的树是没有问题的,只要您对 10 组 50 棵树中的每一个使用相同的数据和参数。此外,您可以查看更有效的随机森林算法版本,例如包ranger,也可以做生存森林,iirc。

【讨论】:

  • 我试过这样做,但是 10 个随机生存森林模型对整个数据的准确性(通过在 R 中运行 RFSRC 包)通过对它们进行平均合并为 1,结果比单一的要差得多整个数据上的 50 棵树随机生存森林模型。这似乎很奇怪。似乎是平均部分或种子选择部分发生了问题
  • 您能否提供一些代码,理想情况下可重现,这些结果出现在哪里?尤其是:您如何准确地平均模型结果?
猜你喜欢
  • 2018-05-27
  • 1970-01-01
  • 2014-04-20
  • 2013-10-26
  • 2020-02-28
  • 2019-09-01
  • 2019-10-23
  • 2020-08-16
  • 2016-10-08
相关资源
最近更新 更多