【发布时间】:2018-11-21 22:44:16
【问题描述】:
我正在尝试在大型 dask 数据帧上创建索引。无论使用哪种调度程序,我都无法使用相当于一个核心的操作。代码是:
(ddf.
.read_parquet(pq_in)
.set_index('title', drop=True, npartitions='auto', shuffle='disk', compute=False)
.to_parquet(pq_out, engine='fastparquet', object_encoding='json', write_index=True, compute=False)
.compute(scheduler=my_scheduler)
)
我在一台 64 核机器上运行它。我能做些什么来利用更多的核心?还是set_index 本身就是顺序的?
【问题讨论】:
标签: dataframe concurrency parallel-processing dask dask-distributed