【发布时间】:2019-04-15 22:22:15
【问题描述】:
我有一个 S3 存储桶,其中包含许多文件(1000 条记录/分钟)。我想对这些丢弃的文件批量触发 Glue ETL 作业。
我曾研究过使用 Firehose 来聚合事件批次,但这需要大量的链接资源。像 S3 -> Lambda -> Firehose -> ...
批量处理数据的最佳方式是什么?
【问题讨论】:
标签: amazon-web-services bigdata etl aws-glue
我有一个 S3 存储桶,其中包含许多文件(1000 条记录/分钟)。我想对这些丢弃的文件批量触发 Glue ETL 作业。
我曾研究过使用 Firehose 来聚合事件批次,但这需要大量的链接资源。像 S3 -> Lambda -> Firehose -> ...
批量处理数据的最佳方式是什么?
【问题讨论】:
标签: amazon-web-services bigdata etl aws-glue
您可以使用 AWS Glue 作业触发器,它允许您按计划的时间间隔运行胶水作业,而不是作为 S3 事件触发器?
您正在处理流数据吗?仅凭您有限的信息,看不到 Firehose 的用例/用途。
【讨论】: