【发布时间】:2020-12-03 20:04:59
【问题描述】:
我正在尝试从 Spark 写入 S3 上的单个文件。做这样的事情
dataframe.repartition(1)
.write
.option("header", "true")
.option("timestampFormat", "yyyy/MM/dd HH:mm:ss ZZ")
.option("maxRecordsPerFile", batchSize)
.option("delimiter", delimiter)
.option("quote", quote)
.format(format)
.mode(SaveMode.Append)
.save(tempDir)
现在我在写入之前强制分区为 1(我也尝试过coalesce),我希望写入一个输出文件。但事实并非如此,这个我的文件数和之前写的分区数一样多。
如何确保 S3 上只有一个输出文件?
【问题讨论】:
标签: scala apache-spark amazon-s3 apache-spark-sql spark-csv