【发布时间】:2019-09-12 11:23:51
【问题描述】:
>>> rdd = sc.parallelize(range(10), 2)
>>> rdd.glom().collect()
[[0, 1, 2, 3, 4], [5, 6, 7, 8, 9]]
>>> rdd.repartition(3).glom().collect()
[[], [0, 1, 2, 3, 4], [5, 6, 7, 8, 9]]
>>>
第一个分区是空的?为什么?非常感谢您告诉我原因。
【问题讨论】:
-
您是担心第一个分区为空还是某个分区为空?
标签: apache-spark pyspark rdd