【问题标题】:save a csv file into s3 bucket from pypark dataframe将 csv 文件从 pyspark 数据帧保存到 s3 存储桶中
【发布时间】:2019-11-07 12:10:17
【问题描述】:

我想将 spark 数据帧的内容保存到 s3 存储桶中的 csv 文件中:

df_country.repartition(1).write.csv('s3n://bucket/test/csv/a',sep=",",header=True,mode='overwrite')

创建文件名的问题:part-00000-fc644e84-7579-48。

有什么办法可以修复这个文件的名字。比如 test.csv?

谢谢

最好的

【问题讨论】:

    标签: dataframe amazon-s3 pyspark


    【解决方案1】:

    这是不可能的,因为作业中的每个分区都会创建自己的文件,并且必须遵循严格的约定以避免命名冲突。推荐的解决方案是在创建文件后重命名文件。

    另外,如果您知道每个路径只写入一个文件。 前任。 s3n://bucket/test/csv/a。那么文件的名称是什么并不重要,只需读入该唯一目录名称的所有内容即可。

    来源: 1.Specifying the filename when saving a DataFrame as a CSV 2.Spark dataframe save in single file on hdfs location

    【讨论】:

      猜你喜欢
      • 2021-07-23
      • 1970-01-01
      • 2018-02-02
      • 1970-01-01
      • 2021-11-01
      • 2018-06-08
      • 1970-01-01
      • 2016-06-18
      • 1970-01-01
      相关资源
      最近更新 更多