【发布时间】:2015-11-03 17:05:29
【问题描述】:
我正在为我的 spark 作业从 s3 加载数以万计的 gzip 压缩文件。这导致一些分区非常小(10 条记录)和一些非常大(10000 条记录)。分区的大小在节点之间分布得很好,因此每个执行程序似乎都在处理相同数量的数据。所以我不确定我是否有问题。
我如何知道是否值得重新分区或合并 RDD?这些中的任何一个都能够在不改组数据的情况下平衡分区吗?此外,RDD 不会被重用,只是映射然后加入另一个 RDD。
【问题讨论】:
标签: apache-spark