【发布时间】:2021-12-27 01:57:47
【问题描述】:
在 Kubernetes 上运行 Spark,3 个 Spark 工作器中的每一个都分配有 8 个内核和 8G 内存,结果
Executor app-xxx-xx/0 finished with state KILLED exitStatus 143
看起来无论计算多么简单或我传递给spark-submit的标志是什么。
例如,
kubectl run -n redacted spark-client --rm -it --restart='Never' \
--image docker.io/bitnami/spark:3.2.0-debian-10-r2 \
-- run-example \
--name my-pi-calc-example-2 \
--master spark://spark-master-svc:7077 \
--deploy-mode cluster \
--driver-memory 4g \
--executor-memory 1g \
--driver-cores 4 \
--executor-cores 4 \
--verbose \
SparkPi 3
在spark-worker-0 上给我以下日志:
21/11/15 22:07:42 INFO DriverRunner: Launch Command: "/opt/bitnami/java/bin/java" "-cp" "/opt/bitnami/spark/conf/:/opt/bitnami/spark/jars/*" "-Xmx4096M" "-Dspark.master=spark://spark-master-svc:7077" "-Dspark.driver.cores=4" "-Dspark.driver.supervise=false" "-Dspark.submit.deployMode=cluster" "-Dspark.driver.memory=4g" "-Dspark.executor.memory=4g" "-Dspark.submit.pyFiles=" "-Dspark.jars=file:///opt/bitnami/spark/examples/jars/scopt_2.12-3.7.1.jar,file:///opt/bitnami/spark/examples/jars/spark-examples_2.12-3.2.0.jar,file:/opt/bitnami/spark/examples/jars/spark-examples_2.12-3.2.0.jar" "-Dspark.rpc.askTimeout=10s" "-Dspark.app.name=my-pi-calc-example-2" "-Dspark.executor.cores=4" "org.apache.spark.deploy.worker.DriverWrapper" "spark://Worker@xx.xx.19.190:34637" "/opt/bitnami/spark/work/driver-20211115220742-0006/spark-examples_2.12-3.2.0.jar" "org.apache.spark.examples.SparkPi" "3" "--verbose"
21/11/15 22:07:44 INFO Worker: Asked to launch executor app-20211115220744-0006/4 for Spark Pi
21/11/15 22:07:44 INFO SecurityManager: Changing view acls to: spark
21/11/15 22:07:44 INFO SecurityManager: Changing modify acls to: spark
21/11/15 22:07:44 INFO SecurityManager: Changing view acls groups to:
21/11/15 22:07:44 INFO SecurityManager: Changing modify acls groups to:
21/11/15 22:07:44 INFO SecurityManager: SecurityManager: authentication disabled; ui acls disabled; users with view permissions: Set(spark); groups with view permissions: Set(); users with modify permissions: Set(spark); groups with modify permissions: Set()
21/11/15 22:07:44 INFO ExecutorRunner: Launch command: "/opt/bitnami/java/bin/java" "-cp" "/opt/bitnami/spark/conf/:/opt/bitnami/spark/jars/*" "-Xmx4096M" "-Dspark.driver.port=42013" "-Dspark.rpc.askTimeout=10s" "org.apache.spark.executor.CoarseGrainedExecutorBackend" "--driver-url" "spark://CoarseGrainedScheduler@spark-worker-0.spark-headless.redacted.svc.cluster.local:42013" "--executor-id" "4" "--hostname" "xx.xx.19.190" "--cores" "4" "--app-id" "app-20211115220744-0006" "--worker-url" "spark://Worker@xx.xx.19.190:34637"
21/11/15 22:07:48 INFO Worker: Asked to kill executor app-20211115220744-0006/4
21/11/15 22:07:48 INFO ExecutorRunner: Runner thread for executor app-20211115220744-0006/4 interrupted
21/11/15 22:07:48 INFO ExecutorRunner: Killing process!
21/11/15 22:07:48 INFO Worker: Executor app-20211115220744-0006/4 finished with state KILLED exitStatus 143
21/11/15 22:07:48 INFO ExternalShuffleBlockResolver: Clean up non-shuffle and non-RDD files associated with the finished executor 4
21/11/15 22:07:48 INFO ExternalShuffleBlockResolver: Executor is not registered (appId=app-20211115220744-0006, execId=4)
21/11/15 22:07:48 INFO ExternalShuffleBlockResolver: Application app-20211115220744-0006 removed, cleanupLocalDirs = true
21/11/15 22:07:48 INFO Worker: Cleaning up local directories for application app-20211115220744-0006
21/11/15 22:07:48 INFO Worker: Driver driver-20211115220742-0006 exited successfully
我可以删除、更改或修改 run-example 或 spark-submit 标志。即使对于像SparkPi 3 这样简单的东西,它似乎也没有效果;执行者被杀死并退出代码 143,几乎没有关于他们实际被杀死的信息。
资源限制在这里不应该是一个问题。这是一个 Kubernetes 集群,包含 3 个 AWS m5.4xlarge 工作节点、16 个 vCPu 和 64GiB RAM,几乎没有其他实际部署在上面。我没有在limits 或requests 上设置Kubernetes spec.resources。 Spark集群部署如下:
argocd app create spark \
--repo https://charts.bitnami.com/bitnami \
--helm-chart spark \
--dest-server https://kubernetes.default.svc \
--insecure \
--helm-set 'worker.replicaCount=3' \
--dest-namespace redacted \
--revision '5.7.9' \
--helm-set worker.coreLimit=8 \
--helm-set worker.memoryLimit=8G \
--helm-set worker.daemonMemoryLimit=4G \
--helm-set master.daemonMemoryLimit=4G
argocd app sync spark
这使用 Spark Bitnami Helm chart 和 ArgoCD/Helm 来部署。
集群部署得很好;例如,我可以看到 Starting Spark worker xxx.xx.xx.xx:46105 with 8 cores, 8.0 GiB RAM 并且所有 3 名工人都加入了。
我在这里缺少什么?我怎样才能更好地调试它并弄清楚资源约束是什么?
有趣的是,我什至可以在本地运行 SparkPi。如果我例如kubectl exec -it spark-worker-0 -- bash:
$ ./bin/run-example SparkPi 3
...
21/11/15 22:22:09 INFO SparkContext: Running Spark version 3.2.0
...
21/11/15 22:22:11 INFO DAGScheduler: Job 0 finished: reduce at SparkPi.scala:38, took 0.634538 s
Pi is roughly 3.1437838126127087
然后我可以添加两个参数以在集群模式下运行,然后繁荣,执行者被杀死:
$ ./bin/run-example \
--master spark://spark-master-svc:7077 \
--deploy-mode cluster SparkPi
# Executor app-20211115222530-0008/2 finished with state KILLED exitStatus 143
【问题讨论】:
-
IIRC,143 是 OOM 错误
-
是的。这就是我困惑的本质。 8GB 的 RAM 不足以将 Pi 计算到 3 位数?我什至尝试将每个工人的 RAM 提升到 16GB。似乎没有任何效果。
-
尝试减少内存。您甚至不需要 4G 的驱动程序内存来计算一个数字的 Pi
-
我也试过了。我从默认值开始,只有在我到处看到“killed 143”时才开始使用
xxx.daemonMemoryLimit=4G。我尝试过调高或调低与内存相关的每个值 - 结果相同。 -
正如我添加到问题中的,我可以从
spark-worker-0的容器外壳运行./bin/run-example SparkPi 3- 它完全没有问题。当我将它指向--master和--deploy-mode cluster时,它就会中断
标签: java apache-spark kubernetes