【发布时间】:2017-08-19 12:01:04
【问题描述】:
看到 Matthew Rocklin 精彩的 pycon 2017 谈论 dask 并立即开始使用它。
我正在研究高光谱记录。总数据集大小约为 1-3 TB,我要分析的每个单独的记录/图像约为 12 GB,并分为 2000 MB 文件(通常每个记录 7 个)。我使用在 h5py 数据集上调用的几个 da.from_array 中的 da.concatenate 将数组连接成一个 dask.array。我注意到 CPU 使用率低,IO 性能差;在我的系统监视器上,磁盘读取速度约为 15-30 MB/s。经验表明,此磁盘的最大读/写速度约为 250 MB/s(RAID-0 中的 2 个 6 TB HDD)。
直觉告诉我问题是许多线程正在读取有问题的 7 个文件(我猜是 24,因为这是我的超线程数),这意味着磁盘搜索正在破坏我的 IO 性能。我如何才能了解 Dask 正在做什么并防止这些搜索?
版本和硬件:Ubuntu 16.04、anaconda python 3.5、dask 0.15.1(conda 中的最新版本)。 2 个六核 Intel Xeon CPU(共 24 个超线程)、80 GB RAM、RAID-0 中的 2 个 HDD。
【问题讨论】:
标签: python performance dask