【发布时间】:2019-01-03 11:50:29
【问题描述】:
我让 Spark 处理 EMR,通过 EMRFS 将 JSON 文件写入 S3:
dataframe
.coalesce(1)
.write()
.option("compression", "gzip")
.mode(SaveMode.Overwrite)
.json(outputPath);
问题是输出文件只包含一个头文件
Content-Type = application/octet-stream。并且缺少另一个Content-Encoding = gzip。
如何在使用 Spark 写入时将元数据 Content-Encoding = gzip 设置为输出文件?
【问题讨论】:
标签: apache-spark amazon-s3 amazon-emr