【问题标题】:What is the difference between Input and Shuffle ReadInput和Shuffle Read有什么区别
【发布时间】:2021-01-30 15:39:33
【问题描述】:

我一直在寻找优化spark.shuffle.partitions 的公式,结果发现了这个post 它提到spark.sql.shuffle.partitions = quotient (shuffle stage input size/target size)/total cores) * total cores

当我查看工作中的各个阶段时,我会看到输入和随机读取(下面的屏幕截图)。它们之间有什么区别? 这里的 shuffle 阶段输入大小实际上意味着 Input 吗?

【问题讨论】:

    标签: apache-spark amazon-emr shuffle


    【解决方案1】:

    Spark UI 记录在这里:https://spark.apache.org/docs/3.0.1/web-ui.html

    相关段落如下:

    • 输入:在此阶段从存储读取的字节数
    • 输出:此阶段写入存储的字节数
    • 随机读取:随机读取的总字节数和读取的记录,包括本地读取的数据和从远程执行程序读取的数据
    • 随机写入:写入磁盘的字节和记录,以便在未来阶段被随机读取

    【讨论】:

    • 啊,那么博客中提到的Shuffle stage input size,其实就是Shuffe Read
    猜你喜欢
    • 2016-06-19
    • 2019-12-21
    • 1970-01-01
    • 2016-07-18
    • 2010-10-09
    • 1970-01-01
    • 2022-01-11
    • 1970-01-01
    相关资源
    最近更新 更多