【发布时间】:2023-04-03 23:51:01
【问题描述】:
集群上的节点进入不健康状态的所有原因是什么?
根据我有限的理解,当给定节点上的 HDFS 利用率超过阈值时,通常会发生这种情况。此阈值由 max-disk-utilization-per-disk-percentage 属性定义。
我观察到有时在 spark-sql 上触发内存密集型 spark 作业或使用 pyspark 节点进入不健康状态。进一步查看后,我在处于不健康状态的节点上进行了 ssh,发现实际上 dfs 利用率低于 75%,并且在我的集群上为上述属性设置的值是 99。
所以我认为还有其他一些我遗漏的事实基本上导致了这种行为。
提前感谢您的帮助。
马尼什·梅赫拉
【问题讨论】:
标签: hdfs apache-spark-sql hadoop-yarn emr amazon-emr