【发布时间】:2014-06-08 11:16:34
【问题描述】:
目前我在 R 中使用“cube”函数进行平衡采样。它适用于中等数量的数据。但是,如果使用 10,000,000+ 的全部人口,R 会挂起。有没有其他适用于“大数据”的替代方案?
【问题讨论】:
-
你能提供a reproducible example吗?
标签: r sampling large-data
目前我在 R 中使用“cube”函数进行平衡采样。它适用于中等数量的数据。但是,如果使用 10,000,000+ 的全部人口,R 会挂起。有没有其他适用于“大数据”的替代方案?
【问题讨论】:
标签: r sampling large-data
首先,您应该重新安装软件包 BalancedSampling 以确保您拥有最新的 1.4 版本。对我来说,N = 10000000 似乎工作得很好(选择样本大约需要 30 秒)
library(BalancedSampling)
N = 10000000 # population size
n = 100 # sample size
p = rep(n/N,N) # inclusion probabilities
X = cbind(p,runif(N),runif(N),runif(N)) # matrix of 3 auxiliary variables
system.time(cube(p,X))
user system elapsed
31.31 0.02 31.42
【讨论】: