【问题标题】:Which daemons are required while setting up spark on yarn cluster?在纱线集群上设置火花时需要哪些守护进程?
【发布时间】:2016-05-09 08:54:08
【问题描述】:

我了解以下是 spark 集群所需的守护进程

  1. 大师
  2. 工人(奴隶)
  3. 驱动程序(提交申请时启动)
  4. Executors(提交申请时启动)

当我在纱线集群上设置 Spark 时,我有一些非常基本的问题

  1. spark 是否有单独启动的主守护进程或工作守护进程?我了解纱线集群本身的资源管理器和节点管理器将充当火花作业的主人和工人。从这篇文章http://blog.cloudera.com/blog/2014/05/apache-spark-resource-management-and-yarn-app-models/ 看来,纱线上的火花似乎没有单独的主/从守护进程。
  2. 如果上述问题的答案是否定的。当我们尝试在现有纱线上设置火花时,我们是否需要在提交火花应用程序之前启动任何持久守护程序?
  3. spark-1.5.0-bin-hadoop2.4\sbin 目录中的任何启动-停止脚本都将在这种情况下有用吗?
  4. 一旦驱动程序完成执行,Spark WEB UI 将不可用。我说的对吗?

【问题讨论】:

    标签: hadoop apache-spark cluster-computing hadoop-yarn


    【解决方案1】:

    以下是您问题的答案:-

    1. 在 yarn 模式下,您不需要 Master、Worker 或 Executors。您只需将您的应用程序提交给 Yarn,其余的 Yarn 将自行管理。请参阅 Deployment 如何将 Yarn 用作集群管理器的部分。
    2. 如果您的 Yarn 集群已启动并运行并准备好服务,那么您不需要任何其他守护程序。
    3. 取决于您想要做什么,但可以使用 SPARK_HOME/sbin/spark-config.shSPARK_HOME/sbin/start-history-server.sh 等脚本。
    4. Spark Web UI 仅在独立模式下可用。在您的作业执行时,纱线驱动程序 UI 可用,或者您需要打开历史服务器以在作业完成后分析作业。

    【讨论】:

    • 谢谢苏米特。实际上我正在通过这个链接在纱线上设置火花。 backtobazics.com/big-data/… 如果您在此页面中看到第 3 步,它会在基本配置设置后尝试从 sbin 文件夹启动一些守护进程。
    • 在博客作者中设置并以独立模式运行示例 Spark 作业。 Yarn 仅用于 HDFS。这个Link 将使您更清楚地了解 Spark 部署的各种模式。
    猜你喜欢
    • 2016-10-11
    • 2023-03-09
    • 2014-12-17
    • 2018-02-22
    • 2015-10-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-03-25
    相关资源
    最近更新 更多