【发布时间】:2012-04-19 16:52:07
【问题描述】:
我在 R 中有一个大型数据集(1M+ 行 x 6 列),我想用它来训练随机森林(使用 randomForest 包)以进行回归。不幸的是,我在尝试一次完成整个事情时遇到Error in matrix(0, n, n) : too many elements specified 错误,并且在数据子集上运行时无法分配足够的内存类型的错误 - 低至 10,000 左右的观察.
看到我不可能在我的机器上添加更多 RAM 并且随机森林非常适合我尝试建模的进程类型,我真的很想完成这项工作。
非常感谢任何建议或解决方法的想法。
【问题讨论】:
-
按照joran 的建议使用
proximity = FALSE运行并告诉我们它是否有效。 -
解决问题的一种相对简单的方法是对输入矩阵进行子集化。所有这些数据可能不会为您提供比大小为 10K x 10K 的模型更好的模型。
-
你看过 library(h2o) 吗?对于非常大的问题,这运行正常,请参阅r-bloggers.com/benchmarking-random-forest-implementations
标签: r machine-learning random-forest