【发布时间】:2017-07-11 21:10:11
【问题描述】:
我可能对加入/groupBy-agg 有一个幼稚的问题。在RDD的日子里,每当我想表演时 一种。 groupBy-agg,我曾经说 reduceByKey(PairRDDFunctions 的)带有可选的 Partition-Strategy(带有分区数或 Partitioner) 湾。 join (of PairRDDFunctions) 及其变体,我曾经有一种方法来提供分区数
在DataFrame中,如何在这个操作中指定分区数?事后我可以使用 repartition() 。但这将是工作中的另一个阶段。
在连接期间增加分区/任务数量的一种解决方法是在 spark-submit 期间将“spark.sql.shuffle.partitions”设置为某个所需的数字。我正在尝试查看是否有办法以编程方式为 groupBy-agg / join 的每个步骤提供此功能?
以编程方式执行此操作的原因是,根据数据帧的大小,我可以使用更多或更少的任务来避免 OutOfMemoryError。
【问题讨论】:
标签: apache-spark join group-by apache-spark-sql spark-dataframe