【发布时间】:2017-10-17 21:37:23
【问题描述】:
我有一个非常大的数 GB 文件,加载到内存中的成本太高。但是,文件中行的顺序不是随机的。有没有办法使用 fread 之类的方法读取行的随机子集?
例如,像这样的东西?
data <- fread("data_file", nrows_sample = 90000)
这个github post 建议一种可能性是做这样的事情:
fread("shuf -n 5 data_file")
但是,这对我不起作用。有什么想法吗?
【问题讨论】:
标签: r