【发布时间】:2018-09-24 09:51:28
【问题描述】:
我有一个 6.5Gb 的数据表。我想用ParLapply 在一个循环中做一些并行计算(例如运行回归)。目前,当我在并行包中尝试clusterExport 时,它需要很长时间(我从未见过它完成导出它)。
我有 16 个内核和 64Gb 的 RAM。正常吗?如何加快大数据表的导出速度?
num_cores = (detectCores(all.tests = FALSE, logical = TRUE) - 2)
workers <- parallel::makePSOCKcluster(num_cores, useXDR=F)
for(pck_name in required.pck){
clusterExport(workers, c("pck_name"), envir = environment())
clusterEvalQ(workers, library(pck_name, character.only=TRUE))
}
# Bit that freezes up
clusterExport(workers, varlist = c("big_data_table"), envir
= environment())
【问题讨论】:
标签: r parallel-processing