【发布时间】:2020-04-25 02:22:10
【问题描述】:
我正在尝试在 aws s3 中读取分区数据集,它看起来像:
MyDirectory--code=1--file.parquet
--code=2--another.parquet
--code=3--another.parquet
我创建了一个文件列表,其中包含目录中所有文件的路径,然后执行
df = pq.ParquetDataset(file_list, filesystem=fs).read().to_pandas()
除了数据框 df 中不存在分区列代码外,一切正常。 我也尝试过使用 file_list 的 MyDirectory 的一个路径,但发现错误 “在中间目录中找到文件:s3://bucket/Mydirectoty”,我在网上找不到任何答案。
谢谢!
【问题讨论】:
标签: pandas amazon-s3 parquet pyarrow