【发布时间】:2017-02-07 05:19:28
【问题描述】:
有两个不同的RDD,我想对这两个rdd进行zipPartition,在此之前,我希望两个RDD中相同id的partition可以持久化在同一个executor中,这样zipPartition时就不会出现shuffle。
【问题讨论】:
标签: apache-spark
有两个不同的RDD,我想对这两个rdd进行zipPartition,在此之前,我希望两个RDD中相同id的partition可以持久化在同一个executor中,这样zipPartition时就不会出现shuffle。
【问题讨论】:
标签: apache-spark
您必须将您的 RDD 包装在一个实现此方法的新 RDD 中:
def getPreferredLocations(split: Partition): Seq[String]
上述方法告诉调度程序——应该计算给定分区的首选位置。
[我在对 2 个 RDD 进行 Hashjoin 时遇到了类似的问题,并在博客上对此进行了讨论。你可能想看看here。]
【讨论】: