【问题标题】:How to persist one partition to specific executor in Spark?如何将一个分区持久化到 Spark 中的特定执行程序?
【发布时间】:2017-02-07 05:19:28
【问题描述】:

有两个不同的RDD,我想对这两个rdd进行zipPartition,在此之前,我希望两个RDD中相同id的partition可以持久化在同一个executor中,这样zipPartition时就不会出现shuffle。

【问题讨论】:

    标签: apache-spark


    【解决方案1】:

    您必须将您的 RDD 包装在一个实现此方法的新 RDD 中:

    def getPreferredLocations(split: Partition): Seq[String]
    

    上述方法告诉调度程序——应该计算给定分区的首选位置。

    [我在对 2 个 RDD 进行 Hashjoin 时遇到了类似的问题,并在博客上对此进行了讨论。你可能想看看here。]

    【讨论】:

    猜你喜欢
    • 2016-07-17
    • 2016-02-14
    • 1970-01-01
    • 2018-02-16
    • 2020-02-05
    • 1970-01-01
    • 2021-07-11
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多