【发布时间】:2015-08-08 07:32:32
【问题描述】:
如果我创建两个这样的 rdd:
a = sc.parallelize([[1 for j in range(3)] for i in xrange(10**9)])
b = sc.parallelize([[1 for j in xrange(10**9)] for i in range(3)])
当您认为第一个分区很直观时,数十亿行围绕工作人员进行分区。 但是第二个有 3 行,每行有十亿个项目。
我的问题是:对于第二行,如果我有 2 名工人,一排给一名工人,另外两排给另一名工人吗?
【问题讨论】:
标签: apache-spark pyspark rdd