【问题标题】:Get Filename of spark data frame write获取火花数据帧写入的文件名
【发布时间】:2018-11-27 06:22:17
【问题描述】:

我正在使用以下代码将 spark 数据帧写入 s3 存储桶。

spark_df. \
coalesce(1). \
write. \
option("header", "true"). \
mode("overwrite"). \
csv(bucket_name + "/" + bucket_path + "/csv")

在这里,我想获取正在写入 s3 bukcet 的文件的名称,并希望将该文件用作后面代码部分的一部分。

Specifying the filename when saving a DataFrame as a CSV

我已经解决了上述问题,因为我们在将数据帧写入 s3 存储桶时无法提供文件名。

我正在考虑遍历 s3 存储桶并根据最新的时间戳获取文件(通常一次写入一个文件)。

有人可以建议我如何根据最新的时间戳从 s3 存储桶中获取文件名(使用 python)

【问题讨论】:

    标签: python dataframe amazon-s3 pyspark filenames


    【解决方案1】:

    作业中的每个分区都会创建自己的文件。而是在逐个目录的基础上工作:创建的所有文件都是输出。也许如果你使用 .repartition (1) 你可以将所有内容合并到一个文件中 - 你可以在那里尝试一些实验

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2021-10-15
      • 2019-02-11
      • 1970-01-01
      • 2016-03-30
      • 1970-01-01
      • 2020-08-11
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多