【发布时间】:2017-05-02 00:55:29
【问题描述】:
我有一个关于在 YARN 上以集群模式运行的 Apache Spark 的问题。根据this thread,Spark 本身不必安装在集群中的每个(工作)节点上。我的问题在于 Spark Executors:一般来说,YARN 或者更确切地说是资源管理器应该决定资源分配。因此,Spark Executors 可以在集群中的任何(工作)节点上随机启动。但是,如果 Spark 没有安装在任何(worker)节点上,YARN 如何启动 Spark Executors?
【问题讨论】:
-
Executors 需要以某种方式提供 Spark 运行时。这可以通过在节点上安装或随您的应用程序一起提供,例如在一个捆绑 Spark 的胖罐子里。我认为...
-
您不必将二进制文件包含在 fatjar/uberjar 中——它由 spark-submit 自动提供。
标签: hadoop apache-spark hadoop-yarn