【发布时间】:2014-06-24 07:56:19
【问题描述】:
我们的 Hadoop 集群是一个包含 5 个数据节点和 2 个名称节点的集群。流量实际上非常高,一些节点经常出现故障。但他们会在一段时间后回来。有时需要很长时间,半个多小时才能活着回来。
很少有 DN 的线程数比其他 DN 多。这是配置问题吗? 数据不是写密集型的。 MR 作业每 20 分钟运行一次。
在运行健康监视器两天后,每隔半小时采样一次,我们得知节点在每 6 小时运行一次的磁盘验证期间死亡。所以现在节点可以预见地死亡。但是为什么他们会在磁盘验证期间死掉呢?有没有办法在磁盘验证期间防止节点死亡??
【问题讨论】:
-
日志中有错误信息吗?如果是这样,请将这些添加到您的问题中。
-
日志中没有任何错误信息。
-
org.apache.hadoop.hdfs.BlockMissingException: 无法获取块