【发布时间】:2016-11-14 10:32:54
【问题描述】:
问题:我正在尝试对数据集进行重新分区,以便指定整数列中具有相同编号的所有行都位于同一分区中。
工作原理:当我将 1.6 API(Java 中)与 RDD 一起使用时,我使用了一个哈希分区器,它按预期工作。例如,如果我为每一行打印此列的每个值的模数,我在给定分区中得到相同的模数(我通过手动读取使用 saveAsHadoopFile 保存的内容来读取分区)。
使用最新的 API 无法正常工作
但现在我正在尝试使用 2.0.1 API(在 Scala 中)和具有重新分区方法的数据集,该方法采用多个分区和一列并将此数据集保存为镶木地板文件。如果我在给定此列的情况下查看未分区行的分区,结果会有所不同。
【问题讨论】:
标签: java scala hadoop apache-spark