【问题标题】:Co-partitioned joins in spark SQLspark SQL 中的共同分区连接
【发布时间】:2015-05-05 05:07:27
【问题描述】:

是否有任何 Spark SQL 数据源的实现提供 Co-partition 连接 - 最有可能通过 CoGroupRDD?我在现有的 Spark 代码库中没有看到任何用途。

动机是在两个表具有相同数量和相同分区键范围的情况下大大减少 shuffle 流量:在这种情况下,将有一个 Mx1 而不是 >MxN随机扇出。

目前在 Spark SQL 中唯一的大规模连接实现似乎是 ShuffledHashJoin - 确实需要 MxN shuffle fanout,因此很贵。

【问题讨论】:

    标签: apache-spark apache-spark-sql


    【解决方案1】:

    我认为您正在寻找应该在 Spark 2.0 中出现的 Bucket Join optimization

    在 1.6 中,您可以完成类似的操作,但只能通过缓存数据。 SPARK-4849

    【讨论】:

    • 谢谢迈克尔。期待桶的加入。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2018-10-05
    • 1970-01-01
    • 1970-01-01
    • 2019-02-10
    • 2016-03-06
    • 2020-10-11
    • 2016-10-14
    相关资源
    最近更新 更多