【问题标题】:Unhealthy node on the cluster集群上的不健康节点
【发布时间】:2023-04-03 23:51:01
【问题描述】:

集群上的节点进入不健康状态的所有原因是什么?

根据我有限的理解,当给定节点上的 HDFS 利用率超过阈值时,通常会发生这种情况。此阈值由 max-disk-utilization-per-disk-percentage 属性定义。

我观察到有时在 spark-sql 上触发内存密集型 spark 作业或使用 pyspark 节点进入不健康状态。进一步查看后,我在处于不健康状态的节点上进行了 ssh,发现实际上 dfs 利用率低于 75%,并且在我的集群上为上述属性设置的值是 99。

所以我认为还有其他一些我遗漏的事实基本上导致了这种行为。

提前感谢您的帮助。

马尼什·梅赫拉

【问题讨论】:

    标签: hdfs apache-spark-sql hadoop-yarn emr amazon-emr


    【解决方案1】:

    每个 hadoop 节点(从)上的 YARN 节点管理器将根据运行状况检查器确定的启发式方法将节点标记为不健康。默认情况下,它将是磁盘检查器。如果设置,它也可以是外部健康检查器。

    https://hadoop.apache.org/docs/current/hadoop-yarn/hadoop-yarn-site/NodeManager.html#Health_checker_service

    默认Disk Checker 检查节点上的可用磁盘空间,如果磁盘超过 90%,它将标记节点不健康。 (这是默认设置,在 yarn.nodemanager.disk-health-checker.max-disk-utilization-per-disk-percentage 中设置)

    在您的情况下,您似乎正在检查跨节点的 HDFS 使用情况。您需要使用“df -h”来验证各个节点上的磁盘利用率,以检查该节点上的磁盘使用情况。如果您看到像 /mnt/ 这样的卷超过 99% ,那么它将被标记为不健康。

    您需要找出占用磁盘空间最多的顶级目录并采取相应的措施。 HDFS 将使用节点上的磁盘(使用 dfs.data.dir 设置),如果在作业运行期间其利用率非常高,可能会导致节点不健康。但是,如果 HDFS 利用率不高,节点可能会变得不健康。

    【讨论】:

      猜你喜欢
      • 2021-04-12
      • 2021-04-24
      • 1970-01-01
      • 2021-04-11
      • 1970-01-01
      • 2021-05-29
      • 2022-10-18
      • 2020-01-14
      • 1970-01-01
      相关资源
      最近更新 更多