【发布时间】:2018-06-01 19:33:49
【问题描述】:
我在 AWS S3 中有超过 1200 个 JSON 文件,我需要将它们转换为 Parquet 并拆分成更小的文件(我正在为 Redshift Spectrum 准备它们)。我试图创建一个 Lambda 函数,为每个文件执行此操作。但是该函数需要很长时间才能完成或消耗大量内存,因此在完成之前结束。这些文件大约为 3-6 GB。
顺便说一句。我使用 Python。
我不想为此启动 EC2,因为这需要很长时间才能完成。
我想要一些关于如何完成此任务的建议。
【问题讨论】:
标签: python json amazon-web-services aws-lambda parquet