【发布时间】:2021-01-30 15:39:33
【问题描述】:
我一直在寻找优化spark.shuffle.partitions 的公式,结果发现了这个post
它提到spark.sql.shuffle.partitions = quotient (shuffle stage input size/target size)/total cores) * total cores
当我查看工作中的各个阶段时,我会看到输入和随机读取(下面的屏幕截图)。它们之间有什么区别?
这里的 shuffle 阶段输入大小实际上意味着 Input 吗?
【问题讨论】:
标签: apache-spark amazon-emr shuffle