【发布时间】:2016-09-24 21:40:17
【问题描述】:
最近我一直在调整一些大型、shuffle 繁重的工作的性能。查看 spark UI,我注意到附加指标部分下有一个名为“Shuffle Read Blocked Time”的选项。
对于大量任务,这种“随机读取阻塞时间”似乎占任务持续时间的 50% 以上。
虽然我可以凭直觉知道这意味着什么,但我找不到任何文档来解释它的实际含义。不用说,我也找不到任何有关缓解策略的资源。
谁能提供一些关于如何减少随机读取阻塞时间的见解?
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql