【问题标题】:AWS Glue ETL Job triggered on batches of S3 Events批量 S3 事件触发的 AWS Glue ETL 作业
【发布时间】:2019-04-15 22:22:15
【问题描述】:

我有一个 S3 存储桶,其中包含许多文件(1000 条记录/分钟)。我想对这些丢弃的文件批量触发 Glue ETL 作业。

我曾研究过使用 Firehose 来聚合事件批次,但这需要大量的链接资源。像 S3 -> Lambda -> Firehose -> ...

批量处理数据的最佳方式是什么?

【问题讨论】:

    标签: amazon-web-services bigdata etl aws-glue


    【解决方案1】:

    您可以使用 AWS Glue 作业触发器,它允许您按计划的时间间隔运行胶水作业,而不是作为 S3 事件触发器?

    您正在处理流数据吗?仅凭您有限的信息,看不到 Firehose 的用例/用途。

    【讨论】:

    • 如果我们传递实际数据,Firehose 对我们的应用程序的批处理大小很小。我们传递的记录只是指向 S3 中文件的指针,但我们需要大批量处理这些文件。
    猜你喜欢
    • 2018-01-30
    • 1970-01-01
    • 1970-01-01
    • 2019-01-29
    • 1970-01-01
    • 2022-07-21
    • 2021-07-29
    • 2019-12-15
    • 1970-01-01
    相关资源
    最近更新 更多