【发布时间】:2021-03-17 12:27:14
【问题描述】:
场景:我想对一个文件(~100 MB)执行简单的计算。我有数千个这样的文件。对于此示例,将计算视为“计算行数”。
Dask:我正在使用 Dask 来并行化读取和计算。
工作原理:如果每个文件都非常大(45 GB),那么在我的集群(12 台使用 PBS 的计算机)中专用 1 台计算机(70GB 内存)来读取和计算是有意义的。
from dask_jobqueue import PBSCluster
cluster = PBSCluster(cores=1,processes=1,memory='70GB',queue='extra',project='abcd',walltime='12:00:00',interface='ib0',local_directory='/home/abcd/dask_workers/')
cluster.scale(jobs=12)
print(cluster.job_script())
from dask.distributed import Client, progress
client = Client(cluster)
问题:当文件很小(~100 MB)时,我希望集群中的 1 台计算机并行读取和计算多个文件。
问题:哪个参数将允许集群中的 1 台计算机并行进行多次读取和计算。
【问题讨论】:
标签: python dask dask-distributed