【问题标题】:pySpark: is it possible to groupBy() with one single node per group?pySpark:是否可以 groupBy() 每组一个节点?
【发布时间】:2016-10-11 04:13:46
【问题描述】:

我正在使用 pySpark 来计算每组矩阵。如果 Spark 将任何给定组的行存储在单个节点上,看起来计算会更快,因此 Spark 可以在本地计算每个矩阵。恐怕节点间的合作可能需要更长的时间。

map() 和groupBy() 通常会实现这种东西吗?如果可能的话,我是否应该尝试将其指定为一个选项?

注意。矩阵包括计算每个(排序的)组内每行与前一行之间的距离。

【问题讨论】:

    标签: apache-spark parallel-processing group-by pyspark pyspark-sql


    【解决方案1】:

    Spark 似乎默认会这样做。

    请看这里:http://backtobazics.com/big-data/spark/apache-spark-groupby-example/

    【讨论】:

      【解决方案2】:

      我猜你问的是mapPartitions()。然后操作在每个分区本地进行。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2018-03-20
        • 2020-07-29
        • 1970-01-01
        • 1970-01-01
        • 2017-12-27
        • 2019-09-17
        相关资源
        最近更新 更多