【问题标题】:About negative binomial regression in large data关于大数据中的负二项式回归
【发布时间】:2014-02-03 07:17:12
【问题描述】:

我有一个大约 19 列和超过 1000 万行的数据。现在我想运行负二项式回归。

由于内存是瓶颈,我打算使用ff包来解决这个问题。但事实证明,MASS 包中的函数glm.nb 在这种情况下无法使用。还有一个ffbase 包,它有一些增强的功能,但没有glm.nb。

bigmemory和biganalyticspackages也有这样的问题。

我不知道我的理解是否正确。或者确实有一种可行的方法来合并ff 和MASS。那么接下来如何进行呢?

PS,我用的是windows……处理这么大的数据似乎是个诅咒……

感谢任何链接、cmets 或提示!

【问题讨论】:

  • 哪个版本的Windows和多少内存?无论安装了多少 RAM,32 位 Windows 7 只能识别大约 3GB,但 64 位版本没有此限制。如果您无法为自己的系统找到替代解决方案,Amazon EC2 等 Web 服务会提供廉价的计算能力。
  • Matt Weller,感谢您的 cmets。我有 8 Gb 内存和 64 位窗口。不过好像内存还不够……
  • 也许请 MASS 包的作者 (Brian Ripley) 允许 glm.nb 处理 ffdf 对象。没有详细查看它,但它可能相对简单,因为 glm.nb 中的代码说 glm.fitter 应该替换为 ffbase::bigglm.ffdf 以使其工作。

标签: r large-data


【解决方案1】:

对您的数据点进行随机抽样。进行分析。重复。估计由于此蒙特卡罗过程引起的方差。如果您得到的参数仍然显着非零,则停止。

【讨论】:

    猜你喜欢
    • 2018-10-06
    • 1970-01-01
    • 1970-01-01
    • 2021-07-07
    • 1970-01-01
    • 2019-03-19
    • 2013-09-05
    • 2014-07-27
    • 2017-03-04
    相关资源
    最近更新 更多