【发布时间】:2018-11-27 06:22:17
【问题描述】:
我正在使用以下代码将 spark 数据帧写入 s3 存储桶。
spark_df. \
coalesce(1). \
write. \
option("header", "true"). \
mode("overwrite"). \
csv(bucket_name + "/" + bucket_path + "/csv")
在这里,我想获取正在写入 s3 bukcet 的文件的名称,并希望将该文件用作后面代码部分的一部分。
Specifying the filename when saving a DataFrame as a CSV
我已经解决了上述问题,因为我们在将数据帧写入 s3 存储桶时无法提供文件名。
我正在考虑遍历 s3 存储桶并根据最新的时间戳获取文件(通常一次写入一个文件)。
有人可以建议我如何根据最新的时间戳从 s3 存储桶中获取文件名(使用 python)
【问题讨论】:
标签: python dataframe amazon-s3 pyspark filenames