【发布时间】:2018-07-08 21:34:10
【问题描述】:
我正在尝试通过 S3 构建解决方案。我有很多文件每小时转储到 s3。现在在 spark 中我需要处理这些文件并再次写回 s3。最好的方法是什么?我想到的一种方法是
1) 每当将文件写入 s3 时,都会在 SQS 中生成事件 2) 以批处理方式运行的Spark会读取sqs事件,处理当时s3中的所有事件,然后写回s3。
我在这里看到的问题是 1)如果在从sqs中删除消息之前处理spark中的消息并写入s3之后,我的公园会发生什么?是否可以将sqs删除并写入s3作为spark中的原子操作?
【问题讨论】:
标签: apache-spark amazon-s3 emr