【发布时间】:2018-06-18 01:00:06
【问题描述】:
我需要join 基于一些共享键列的多个 DataFrame。对于键值 RDD,可以指定一个分区器,以便将具有相同键的数据点洗牌到同一个执行器,这样加入效率更高(如果在 join 之前有洗牌相关操作)。可以在 Spark DataFrames 或 DataSets 上做同样的事情吗?
【问题讨论】:
标签: apache-spark apache-spark-sql spark-dataframe partitioning apache-spark-dataset