【发布时间】:2017-06-24 15:05:12
【问题描述】:
我有一个常见问题,我启动 AWS EMR 集群并通过 SSH 登录,然后运行 spark-shell 以测试一些 Spark 代码,有时我失去了互联网连接,Putty 抛出连接丢失的错误。
但似乎 Spark 相关进程仍在运行。当我重新连接到服务器并再次运行spark-shell 时,我收到很多这些错误:
17/02/07 11:15:50 WARN YarnSchedulerBackend$YarnSchedulerEndpoint: Container marked as failed: container_1486465722770_0002_01_000003 on host: ip-172-31-0-217.eu-west-1.compute.internal. Exit status: 1. Diagnostics: Exception from container-launch.
谷歌搜索此错误表明分配的内存存在问题,但由于我在测试集群上使用小节点,我什至不想分配更多内存,我只想释放使用的资源重新启动@ 987654324@,但我没有看到任何“Spark”进程正在运行。
如何轻松解决此问题?是否有其他一些我应该尝试关闭/重新启动的过程,比如 hadoop、mapred、yarn 等?我不想每次遇到这种情况时都启动一个新集群。
【问题讨论】:
标签: apache-spark hadoop-yarn emr amazon-emr elastic-map-reduce