【发布时间】:2017-09-22 05:26:01
【问题描述】:
我正在尝试设置一个流程,以便使用 AWS Data PipeLine 在 EMR 集群中运行 Spark 作业。我们的流程按“按需”计划运行。
作为此活动的一部分,我们在管道的开头创建一个 EMR 集群,然后我们希望在一个 emr 集群上并行运行多个 spark 作业。
我们是否可以使用“按需”计划在 Data Pipe Line 上运行并行作业。
【问题讨论】:
-
为您的集群分配一个“工作组”并让所有 Spark 活动在那里运行。如果它们不相互依赖,它们应该同时开始。然后,您可能只需要在 YARN(或任何调度程序)上配置 Spark,以便以最有效的方式处理并发作业。
-
谢谢,这个选项有效。除此之外,是否可以在我的 EMRActivity 失败时运行单独的活动(可以是任何活动)。我只能看到我们可以发送通知。我可以通过 lambda 处理我的通知并且可以处理它。但是在同一个管道中是可能的。
-
@user4601931 你能分享更多关于如何配置 Yarn 来处理并发作业的细节
标签: apache-spark amazon-emr amazon-data-pipeline