【问题标题】:How to run multiple parallel spark job in AWS EMR clusters through AWS Data Pipe line如何通过 AWS Data Pipe line 在 AWS EMR 集群中运行多个并行 Spark 作业
【发布时间】:2017-09-22 05:26:01
【问题描述】:

我正在尝试设置一个流程,以便使用 AWS Data PipeLine 在 EMR 集群中运行 Spark 作业。我们的流程按“按需”计划运行。

作为此活动的一部分,我们在管道的开头创建一个 EMR 集群,然后我们希望在一个 emr 集群上并行运行多个 spark 作业。

我们是否可以使用“按需”计划在 Data Pipe Line 上运行并行作业。

【问题讨论】:

  • 为您的集群分配一个“工作组”并让所有 Spark 活动在那里运行。如果它们不相互依赖,它们应该同时开始。然后,您可能只需要在 YARN(或任何调度程序)上配置 Spark,以便以最有效的方式处理并发作业。
  • 谢谢,这个选项有效。除此之外,是否可以在我的 EMRActivity 失败时运行单独的活动(可以是任何活动)。我只能看到我们可以发送通知。我可以通过 lambda 处理我的通知并且可以处理它。但是在同一个管道中是可能的。
  • @user4601931 你能分享更多关于如何配置 Yarn 来处理并发作业的细节

标签: apache-spark amazon-emr amazon-data-pipeline


【解决方案1】:

你可以看看这个例子
https://github.com/ychantit/airflow_aws_utils 基本上,您需要提交使用 ssh 连接到 emr 的作业并自己观察作业的执行 但它没有使用 aws datapipeline...

【讨论】:

    猜你喜欢
    • 2018-10-19
    • 1970-01-01
    • 2018-11-13
    • 2020-11-08
    • 1970-01-01
    • 2019-06-06
    • 1970-01-01
    • 2018-02-08
    • 2020-02-11
    相关资源
    最近更新 更多