【发布时间】:2021-06-04 11:55:55
【问题描述】:
有人可以帮助使用 pyspark 中的一些代码来遍历文件夹和子文件夹以获取最新文件。
文件夹和子文件夹如下所示。现在我想循环到最新年份文件夹,然后是最新月份文件夹,然后是最新日期文件夹来获取文件。
Raw/2019
Raw/2020/06/21
Raw/2021/03/18/file.csv
Raw/2021/04/13/file.csv
Raw/2021/04/14/file.csv
【问题讨论】:
-
为什么需要 pyspark?文件是否存储在 hdfs 中?
-
@pythonic833 这是增量数据。数据将每天加载到数据湖存储中。所以我需要从存储中提取最新的文件。然后我将安装这些数据。
标签: python pyspark databricks azure-databricks azure-data-lake