【问题标题】:Spark: Association with remote system lost akka.tcp (disassociated)Spark:与远程系统的关联丢失了 akka.tcp(解除关联)
【发布时间】:2015-04-18 17:25:19
【问题描述】:

我正在使用带有 Hadoop/Yarn 的 Spark 1.3.0,我收到一条错误消息,上面写着

WARN ReliableDeliverySupervisor:与远程系统 [akka.tcp://sparkYarnAM@virtm2:51482] 的关联失败,地址现在已关闭 为 [5000] 毫秒。原因是:[解除关联]。

我阅读了它,发现将 akka 心跳间隔设置为 100 可以解决这个问题:

SparkConf conf = new SparkConf().setAppName("Name");
conf.set("spark.akka.heartbeat.interval", "100");

不幸的是,我的情况并非如此。几秒钟后,我按 Enter 键后,作业因此错误而失败。

我使用以下命令提交作业:

/usr/local/spark130/bin/spark-submit 
--class de.unidue.langTecspark.TweetTag 
--master yarn-client 
--executor-memory 2g  
--driver-memory 4g 
/home/huser/sparkIt-1.0-standalone.jar

节点上执行容器的日志显示 Application master 已被杀死

5 ERROR yarn.ApplicationMaster: RECEIVED SIGNAL 15: SIGTERM

我试图让一个最小的例子运行,这个(它根本什么都不做......只是看看它是否有同样的问题。):

public static void main(String [] args){
        SparkConf conf = new SparkConf().setAppName("Minimal");
        JavaSparkContext sc = new JavaSparkContext(conf);
        List<Integer> data = Arrays.asList(1, 2, 3, 4, 5);
        JavaRDD<Integer> distData = sc.parallelize(data);
        sc.close();
    }

我再次进入日志,Applicationmaster 已终止错误。这里的问题与内存无关,但我很难跟踪这个问题。

我有一个小型分布式设置,其中有 4 台机器用于数据/处理,1 台用于名称节点。

非常感谢任何帮助!

【问题讨论】:

  • 你的master没有运行!

标签: apache-spark hadoop-yarn


【解决方案1】:

当master和slave没有正常启动时会出现这个问题。使用./sbin/start-all.sh 启动主服务器和从服务器,然后提交您的申请。

【讨论】:

  • 我在客户端模式下使用纱线。如果我在没有纱线的情况下运行火花,则不会发生问题,我认为主/从没有特别问题。
猜你喜欢
  • 2017-02-17
  • 2017-02-07
  • 2017-07-31
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2023-03-23
相关资源
最近更新 更多