【问题标题】:AWS Glue convert files from JSON to Parquet with same partitions as source tableAWS Glue 将文件从 JSON 转换为 Parquet,其分区与源表相同
【发布时间】:2018-07-22 05:04:33
【问题描述】:

我们正在使用 AWS 胶水转换存储在 S3 数据湖中的 JSON 文件。

这是我遵循的步骤,

  1. 创建了一个爬虫,用于从我们的数据湖生成 Glue 表 具有 JSON 数据的存储桶。

  2. 新创建的表有如下分区,

    姓名、年、月、日、时

  3. 创建了一个粘合作业以将其转换为 Parquet 并存储在不同的存储桶中

通过这些过程,作业成功运行,但新存储桶中的数据未分区。它只是在一个目录下。

我想要实现的是转换后的 parquet 文件应该获得与源表/数据湖存储桶中相同的分区。

另外,我想增加镶木地板文件的文件大小(减少文件数量)。

谁能帮我解决这个问题?

【问题讨论】:

标签: amazon-web-services bigdata aws-glue


【解决方案1】:

尝试以下编写动态框架。

glueContext.write_dynamic_frame.from_options(
frame=<output_dataframe>,
connection_type="s3",
connection_options={"path": "s3://<output_bucket_path>",
                    "partitionKeys": ["Name", "Year", "Month" , "day", "hour"]},
format="parquet")

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2018-10-03
    • 2020-12-30
    • 2018-04-06
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多