【问题标题】:Spark set S3 object metadata while writing to EMRFSSpark 在写入 EMRFS 时设置 S3 对象元数据
【发布时间】:2019-01-03 11:50:29
【问题描述】:

我让 Spark 处理 EMR,通过 EMRFS 将 JSON 文件写入 S3:

dataframe
  .coalesce(1)
  .write()
  .option("compression", "gzip")
  .mode(SaveMode.Overwrite)
  .json(outputPath);

问题是输出文件只包含一个头文件 Content-Type = application/octet-stream。并且缺少另一个Content-Encoding = gzip

如何在使用 Spark 写入时将元数据 Content-Encoding = gzip 设置为输出文件?

【问题讨论】:

    标签: apache-spark amazon-s3 amazon-emr


    【解决方案1】:

    您也可以使用选项(地图)

    val metadataoptions = Map("compression" -> "gzip", "Content-Language" -> "US-En");

    dataframe.coalesce(1).write().mode(SaveMode.Overwrite).options(metadataoptions).json(outputPath);

    你需要导入
    导入 scala.collection.Map;

    【讨论】:

      猜你喜欢
      • 2021-06-06
      • 2018-03-04
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-06-10
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多