【问题标题】:Hadoop data nodes die very oftenHadoop 数据节点经常死机
【发布时间】:2014-06-24 07:56:19
【问题描述】:

我们的 Hadoop 集群是一个包含 5 个数据节点和 2 个名称节点的集群。流量实际上非常高,一些节点经常出现故障。但他们会在一段时间后回来。有时需要很长时间,半个多小时才能活着回来。

很少有 DN 的线程数比其他 DN 多。这是配置问题吗? 数据不是写密集型的。 MR 作业每 20 分钟运行一次。

在运行健康监视器两天后,每隔半小时采样一次,我们得知节点在每 6 小时运行一次的磁盘验证期间死亡。所以现在节点可以预见地死亡。但是为什么他们会在磁盘验证期间死掉呢?有没有办法在磁盘验证期间防止节点死亡??

【问题讨论】:

  • 日志中有错误信息吗?如果是这样,请将这些添加到您的问题中。
  • 日志中没有任何错误信息。
  • org.apache.hadoop.hdfs.BlockMissingException: 无法获取块

标签: hadoop hdfs bigdata nfs


【解决方案1】:

Clouedera's capacity planning 对此给出了见解。如果您在高负载下看到“Bad connect ack with firstBadLink”、“Bad connect ack”、“No route to host”或“Could not get block” IO 异常,很可能是由于网络故障。

【讨论】:

    猜你喜欢
    • 2015-06-29
    • 1970-01-01
    • 1970-01-01
    • 2013-01-12
    • 2023-04-08
    • 2011-09-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多