【发布时间】:2023-03-09 01:38:02
【问题描述】:
我正在尝试将 Spark 应用程序从本地计算机终端提交到我的集群。我正在使用--master 纱线集群。我也需要在我的集群上运行驱动程序,而不是在我提交应用程序的机器上,即我的本地机器上
我正在使用
bin/spark-submit
--class com.my.application.XApp
--master yarn-cluster --executor-memory 100m
--num-executors 50 hdfs://name.node.server:8020/user/root/x-service-1.0.0-201512141101-assembly.jar
1000
出现错误
诊断:java.io.FileNotFoundException:文件 文件:/Users/nish1013/Dev/spark-1.4.1-bin-hadoop2.6/lib/spark-assembly-1.4.1-hadoop2.6.0.jar 不存在
我可以在我的服务列表中看到,
- YARN + MapReduce2 2.7.1.2.3 Apache Hadoop NextGen MapReduce (YARN)
- Spark 1.4.1.2.3 Apache Spark 是一个快速且通用的引擎,用于
大规模数据处理。
已经安装了。
我在本地机器上的 spark-env.sh
export HADOOP_CONF_DIR=/Users/nish1013/Dev/hadoop-2.7.1/etc/hadoop
有没有人遇到过类似的情况?
【问题讨论】:
-
如果你在集群上运行它,那么你的本地设置是不相关的。您应该检查集群节点的设置和文件系统
-
谢谢,我不知道为什么它会抱怨本地文件?
-
Spark 需要该 jar 才能运行。根据您安装的配置,该 jar 假定位于您所说的文件夹中。您有两个选择:您可以将 jar 本地放置到所有集群机器上并正确配置它们,或者您可以放置它进入 HDFS。
-
我将该 jar 添加到 HDFS ,我应该在哪里配置该 jar 的位置?
-
在集群的工作节点上
标签: apache-spark