【问题标题】:Convert and split large JSON files to smaller Parquet files将大型 JSON 文件转换并拆分为更小的 Parquet 文件
【发布时间】:2018-06-01 19:33:49
【问题描述】:

我在 AWS S3 中有超过 1200 个 JSON 文件,我需要将它们转换为 Parquet 并拆分成更小的文件(我正在为 Redshift Spectrum 准备它们)。我试图创建一个 Lambda 函数,为每个文件执行此操作。但是该函数需要很长时间才能完成或消耗大量内存,因此在完成之前结束。这些文件大约为 3-6 GB。

顺便说一句。我使用 Python。

我不想为此启动 EC2,因为这需要很长时间才能完成。

我想要一些关于如何完成此任务的建议。

【问题讨论】:

    标签: python json amazon-web-services aws-lambda parquet


    【解决方案1】:

    AWS Glue 可用于此类任务。您可以创建粘合作业以将 json 格式 day 转换为 parquet 格式并将其保存到您选择的 S3 存储桶中。 https://aws.amazon.com/blogs/big-data/build-a-data-lake-foundation-with-aws-glue-and-amazon-s3/

    【讨论】:

    • 感谢您的提示 :) 我有一个后续问题。我体验到这项工作会创建许多非常小的文件。如何配置 Glue 以创建具有最小文件大小的文件?由于我使用的是 Spectrum,因此我更喜欢至少 64MB 的文件。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2020-09-22
    • 1970-01-01
    • 1970-01-01
    • 2021-06-11
    • 1970-01-01
    • 1970-01-01
    • 2017-01-10
    相关资源
    最近更新 更多