【发布时间】:2021-03-11 11:12:47
【问题描述】:
我需要根据特定的列过滤条件从 s3 存储桶中选择 s3 parquet 文件列表。
文件结构:s3:bucket/folder/file.parquet {文件夹内多个parquet文件}
文件包含 id、名称、地址、邮政编码、deptno、交易时间等信息。
deptno=1,2,3,4..etc(int)
transactiontime="2019-10-24T21:14:39.503Z", "2020-01-10T00:00:00.000Z".. 等(字符串)
现在我想根据条件 deptno,transactiontime 从存储桶中收集 parquet 文件列表(比如说 deptno=2,transactiontime="2019-10-24T21:14:39.503Z")
我们如何才能做到这一点并感谢任何建议。
【问题讨论】:
-
通过 AWS Athena 运行查询是一个选项。您也可以使用 AWS 粘合爬虫在 Athena 中设置表。在此之后,您将能够针对表编写 SQL 并根据需要过滤列条件。 Athena 查询中的“$path”关键字将返回结果的文件名
标签: python apache-spark amazon-s3 pyspark parquet