【发布时间】:2015-05-05 05:07:27
【问题描述】:
是否有任何 Spark SQL 数据源的实现提供 Co-partition 连接 - 最有可能通过 CoGroupRDD?我在现有的 Spark 代码库中没有看到任何用途。
动机是在两个表具有相同数量和相同分区键范围的情况下大大减少 shuffle 流量:在这种情况下,将有一个 Mx1 而不是 >MxN随机扇出。
目前在 Spark SQL 中唯一的大规模连接实现似乎是 ShuffledHashJoin - 确实需要 MxN shuffle fanout,因此很贵。
【问题讨论】:
标签: apache-spark apache-spark-sql