【发布时间】:2014-02-03 07:17:12
【问题描述】:
我有一个大约 19 列和超过 1000 万行的数据。现在我想运行负二项式回归。
由于内存是瓶颈,我打算使用ff包来解决这个问题。但事实证明,MASS 包中的函数glm.nb 在这种情况下无法使用。还有一个ffbase 包,它有一些增强的功能,但没有glm.nb。
bigmemory和biganalyticspackages也有这样的问题。
我不知道我的理解是否正确。或者确实有一种可行的方法来合并ff 和MASS。那么接下来如何进行呢?
PS,我用的是windows……处理这么大的数据似乎是个诅咒……
感谢任何链接、cmets 或提示!
【问题讨论】:
-
哪个版本的Windows和多少内存?无论安装了多少 RAM,32 位 Windows 7 只能识别大约 3GB,但 64 位版本没有此限制。如果您无法为自己的系统找到替代解决方案,Amazon EC2 等 Web 服务会提供廉价的计算能力。
-
Matt Weller,感谢您的 cmets。我有 8 Gb 内存和 64 位窗口。不过好像内存还不够……
-
也许请 MASS 包的作者 (Brian Ripley) 允许 glm.nb 处理 ffdf 对象。没有详细查看它,但它可能相对简单,因为 glm.nb 中的代码说 glm.fitter 应该替换为 ffbase::bigglm.ffdf 以使其工作。
标签: r large-data