【发布时间】:2015-04-18 17:25:19
【问题描述】:
我正在使用带有 Hadoop/Yarn 的 Spark 1.3.0,我收到一条错误消息,上面写着
WARN ReliableDeliverySupervisor:与远程系统 [akka.tcp://sparkYarnAM@virtm2:51482] 的关联失败,地址现在已关闭 为 [5000] 毫秒。原因是:[解除关联]。
我阅读了它,发现将 akka 心跳间隔设置为 100 可以解决这个问题:
SparkConf conf = new SparkConf().setAppName("Name");
conf.set("spark.akka.heartbeat.interval", "100");
不幸的是,我的情况并非如此。几秒钟后,我按 Enter 键后,作业因此错误而失败。
我使用以下命令提交作业:
/usr/local/spark130/bin/spark-submit
--class de.unidue.langTecspark.TweetTag
--master yarn-client
--executor-memory 2g
--driver-memory 4g
/home/huser/sparkIt-1.0-standalone.jar
节点上执行容器的日志显示 Application master 已被杀死
5 ERROR yarn.ApplicationMaster: RECEIVED SIGNAL 15: SIGTERM
我试图让一个最小的例子运行,这个(它根本什么都不做......只是看看它是否有同样的问题。):
public static void main(String [] args){
SparkConf conf = new SparkConf().setAppName("Minimal");
JavaSparkContext sc = new JavaSparkContext(conf);
List<Integer> data = Arrays.asList(1, 2, 3, 4, 5);
JavaRDD<Integer> distData = sc.parallelize(data);
sc.close();
}
我再次进入日志,Applicationmaster 已终止错误。这里的问题与内存无关,但我很难跟踪这个问题。
我有一个小型分布式设置,其中有 4 台机器用于数据/处理,1 台用于名称节点。
非常感谢任何帮助!
【问题讨论】:
-
你的master没有运行!