【发布时间】:2018-07-22 05:04:33
【问题描述】:
我们正在使用 AWS 胶水转换存储在 S3 数据湖中的 JSON 文件。
这是我遵循的步骤,
创建了一个爬虫,用于从我们的数据湖生成 Glue 表 具有 JSON 数据的存储桶。
-
新创建的表有如下分区,
姓名、年、月、日、时
创建了一个粘合作业以将其转换为 Parquet 并存储在不同的存储桶中
通过这些过程,作业成功运行,但新存储桶中的数据未分区。它只是在一个目录下。
我想要实现的是转换后的 parquet 文件应该获得与源表/数据湖存储桶中相同的分区。
另外,我想增加镶木地板文件的文件大小(减少文件数量)。
谁能帮我解决这个问题?
【问题讨论】:
-
您能否将您的
write-dynamic-frame代码添加到您的问题以及您的存储桶中生成文件的路径。你试过Managing Partitions for ETL Output in AWS Glue的示例代码吗?
标签: amazon-web-services bigdata aws-glue