【问题标题】:What is the best approach for this batch spark use case此批处理火花用例的最佳方法是什么
【发布时间】:2018-07-08 21:34:10
【问题描述】:

我正在尝试通过 S3 构建解决方案。我有很多文件每小时转储到 s3。现在在 spark 中我需要处理这些文件并再次写回 s3。最好的方法是什么?我想到的一种方法是

1) 每当将文件写入 s3 时,都会在 SQS 中生成事件 2) 以批处理方式运行的Spark会读取sqs事件,处理当时s3中的所有事件,然后写回s3。

我在这里看到的问题是 1)如果在从sqs中删除消息之前处理spark中的消息并写入s3之后,我的公园会发生什么?是否可以将sqs删除并写入s3作为spark中的原子操作?

【问题讨论】:

    标签: apache-spark amazon-s3 emr


    【解决方案1】:

    尝试使用 AWS Data Pipeline 自动执行此任务。

    如果文件每小时出现在 s3 上,您可以配置为触发 EMR Spark 集群每小时启动一次,处理数据并将结果存储回 s3。

    您的集群可以在作业完成后终止。

    https://docs.aws.amazon.com/datapipeline/latest/DeveloperGuide/dp-console-templates.html

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2015-05-31
      • 2010-09-06
      • 1970-01-01
      • 2016-06-25
      • 2021-12-03
      • 1970-01-01
      • 2021-11-18
      • 2012-09-18
      相关资源
      最近更新 更多