【发布时间】:2019-11-16 05:46:48
【问题描述】:
我有一个包含 100 万行的数据集。
在运行 1 个包含 500 棵树的随机生存森林时,使用 R 中的 randomForestSRC 包,由于内存问题,需要花费大量时间。
那么,我是否可以在相同的数据上运行 10 个随机生存森林,其中包含 50 棵树,每次使用不同的种子,并平均 10 个随机森林的结果(除以 10),这样我就可以获得相当相似的结果结果是有 500 棵树的那棵?
【问题讨论】:
-
您可以这样做,但是您必须对所有模型中的所有树进行平均才能获得相似的结果。分别平均每个模型是不同的。
标签: random-forest