【发布时间】:2015-05-24 02:00:36
【问题描述】:
我正在尝试将一个用 Scala 编写的 Spark 项目从 Spark 1.2.1 升级到 1.3.0,所以我更改了我的 build.sbt,如下所示:
-libraryDependencies += "org.apache.spark" %% "spark-core" % "1.2.1" % "provided"
+libraryDependencies += "org.apache.spark" %% "spark-core" % "1.3.0" % "provided"
然后制作一个assembly jar,然后提交:
HADOOP_CONF_DIR=/etc/hadoop/conf \
spark-submit \
--driver-class-path=/etc/hbase/conf \
--conf spark.hadoop.validateOutputSpecs=false \
--conf spark.yarn.jar=hdfs:/apps/local/spark-assembly-1.3.0-hadoop2.4.0.jar \
--conf spark.serializer=org.apache.spark.serializer.KryoSerializer \
--deploy-mode=cluster \
--master=yarn \
--class=TestObject \
--num-executors=54 \
target/scala-2.11/myapp-assembly-1.2.jar
作业提交失败,终端出现以下异常:
15/03/19 10:30:07 INFO yarn.Client:
15/03/19 10:20:03 INFO yarn.Client:
client token: N/A
diagnostics: Application application_1420225286501_4698 failed 2 times due to AM
Container for appattempt_1420225286501_4698_000002 exited with exitCode: 127
due to: Exception from container-launch:
org.apache.hadoop.util.Shell$ExitCodeException:
at org.apache.hadoop.util.Shell.runCommand(Shell.java:464)
at org.apache.hadoop.util.Shell.run(Shell.java:379)
at org.apache.hadoop.util.Shell$ShellCommandExecutor.execute(Shell.java:589)
at org.apache.hadoop.yarn.server.nodemanager.DefaultContainerExecutor.launchContainer(DefaultContainerExecutor.java:195)
at org.apache.hadoop.yarn.server.nodemanager.containermanager.launcher.ContainerLaunch.call(ContainerLaunch.java:283)
at org.apache.hadoop.yarn.server.nodemanager.containermanager.launcher.ContainerLaunch.call(ContainerLaunch.java:79)
at java.util.concurrent.FutureTask$Sync.innerRun(FutureTask.java:303)
at java.util.concurrent.FutureTask.run(FutureTask.java:138)
at java.util.concurrent.ThreadPoolExecutor$Worker.runTask(ThreadPoolExecutor.java:886)
at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:908)
at java.lang.Thread.run(Thread.java:662)
最后,我去查看 YARN app master 的网页界面(因为工作在那里,我知道它至少做到了这一点),它显示的唯一日志是这些:
Log Type: stderr
Log Length: 61
/bin/bash: {{JAVA_HOME}}/bin/java: No such file or directory
Log Type: stdout
Log Length: 0
我不知道如何解释——{{JAVA_HOME}} 是不是一个文字(包括括号),它以某种方式变成了一个脚本?这是来自工作节点还是驱动程序?我可以做些什么来试验和排除故障?
我确实在集群所有节点的 hadoop 配置文件中设置了JAVA_HOME:
% grep JAVA_HOME /etc/hadoop/conf/*.sh
/etc/hadoop/conf/hadoop-env.sh:export JAVA_HOME=/usr/jdk64/jdk1.6.0_31
/etc/hadoop/conf/yarn-env.sh:export JAVA_HOME=/usr/jdk64/jdk1.6.0_31
自 1.2.1 以来,此行为在 1.3.0 中是否发生了变化?使用 1.2.1 且不做任何其他更改,工作完成。
[注意:我最初将其发布在 Spark 邮件列表上,如果/当我找到解决方案时,我会更新这两个地方。]
【问题讨论】:
-
您必须设置一个名为 JAVA_HOME 的系统变量。
-
我确实设置了 JAVA_HOME,但可能不在正确的位置 - 我正准备通过邮件列表中的跟进来编辑问题。 =)
-
检查您的 JAVA_HOME 的目录/文件权限
-
权限在配置文件和 /usr/jdk64/jdk1.6.0_31 上都是开放的。当我在 Spark 1.2.1 和 1.3.0 下运行它时,它们是一个常数。
-
一个更详细的信息:如果我使用 1.2.1 构建程序集并在服务器上使用 Spark 1.2.1 程序集,但使用 Spark 1.3.0 的
spark-submit提交,错误仍然会发生。显然不是推荐的配置,但也许它会缩小到spark-submit脚本?
标签: java scala hadoop apache-spark