【发布时间】:2015-07-28 22:18:42
【问题描述】:
我有一个包含 10 个节点的 Spark 集群,在第一次使用 Spark Context 后出现此异常:
14/11/20 11:15:13 ERROR UserGroupInformation: PriviledgedActionException as:iuberdata (auth:SIMPLE) cause:java.util.concurrent.TimeoutException: Futures timed out after [120 seconds]
Exception in thread "main" java.lang.reflect.UndeclaredThrowableException: Unknown exception in doAs
at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1421)
at org.apache.spark.deploy.SparkHadoopUtil.runAsSparkUser(SparkHadoopUtil.scala:52)
at org.apache.spark.executor.CoarseGrainedExecutorBackend$.run(CoarseGrainedExecutorBackend.scala:113)
at org.apache.spark.executor.CoarseGrainedExecutorBackend$.main(CoarseGrainedExecutorBackend.scala:156)
at org.apache.spark.executor.CoarseGrainedExecutorBackend.main(CoarseGrainedExecutorBackend.scala)
Caused by: java.security.PrivilegedActionException: java.util.concurrent.TimeoutException: Futures timed out after [120 seconds]
at java.security.AccessController.doPrivileged(Native Method)
at javax.security.auth.Subject.doAs(Subject.java:415)
at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1408)
... 4 more
这个guy 也有类似的问题,但我已经尝试过他的解决方案,但没有奏效。
here 也会发生同样的异常,但这里的问题并不相同,因为我在主服务器或从服务器以及客户端中都使用 spark 版本 1.1.0。
我尝试将超时时间增加到 120 秒,但仍然无法解决问题。
我正在通过脚本部署环境,并且正在使用 context.addJar 将我的代码包含到类路径中。 这个问题是间歇性的,我不知道如何跟踪它为什么会发生。有人在配置 Spark 集群时遇到过这个问题,知道如何解决吗?
【问题讨论】:
-
由于这是 google 中的最佳答案,以供将来参考,如果您的作业在配置的时间段内(spark 2.0 中为 120 秒)停止,则 rpc 超时可能在没有防火墙/网络配置的情况下发生。我现在遇到了这个问题,正在寻找解决方案,而不是增加超时时间。
标签: scala apache-spark