【发布时间】:2020-12-14 05:19:28
【问题描述】:
我正在使用 Kinesis Firehose 通过 lambda 使用 Dyanamo DB 流并将这些记录推送到 S3 存储桶,Glue 作业每小时运行一次以从 S3 中挑选记录,执行重复数据删除,然后最后将记录插入 Redshift。
有什么方法可以使用 Dynamo Streams 中的记录到“Kinesis Data Analytics”,然后在此处执行重复数据删除并将记录插入 Redshift?
我已经浏览了一些链接https://issues.apache.org/jira/browse/FLINK-4582,Consume DynamoDB streams in Apache Flink。
- 这里提到我们可以使用 FlinkKinesisConsumer 来 使用 DynamoDB 流
。 那么我们可以在 Kinesis Data Analytics 中使用这个 FlinkKinesisConsumer,然后直接使用 Dynamo Stream 吗?
【问题讨论】:
-
我不确定我的理解是否正确,您想在 Kinesis Data Analytics 中而不是在 AWS Glue 中进行重复数据删除?我认为这里可以回答:stackoverflow.com/questions/35599069/…
-
@B.Pesevski,我正在寻找 Firehose 和 Glue 是否都可以替换为“Kinesis Data Analytics”
标签: amazon-web-services amazon-redshift amazon-kinesis amazon-dynamodb-streams amazon-kinesis-analytics