【发布时间】:2016-10-11 04:13:46
【问题描述】:
我正在使用 pySpark 来计算每组矩阵。如果 Spark 将任何给定组的行存储在单个节点上,看起来计算会更快,因此 Spark 可以在本地计算每个矩阵。恐怕节点间的合作可能需要更长的时间。
map() 和groupBy() 通常会实现这种东西吗?如果可能的话,我是否应该尝试将其指定为一个选项?
注意。矩阵包括计算每个(排序的)组内每行与前一行之间的距离。
【问题讨论】:
标签: apache-spark parallel-processing group-by pyspark pyspark-sql