【发布时间】:2016-12-07 15:32:39
【问题描述】:
我有一个使用 DataFrameWriter 写入 S3 的数据集。我正在使用 Parquet 并对具有 256 个不同值的列进行 partitionBy 调用。它运行良好,但需要一些时间来写出数据集(并读入其他作业)。在调试中,我注意到编写器只输出 256 个文件,每个后缀一个,尽管我的 repartition 调用指定了 256 个分区。有没有办法增加每个 partitionBy 值的文件输出数?
我的代码如下:
myDS = myDS.repartition(256, functions.col("suffix"));
myDS.write().partitionBy("suffix").parquet(String.format(this.outputPath, "parquet", this.date));
【问题讨论】:
标签: apache-spark apache-spark-sql spark-dataframe