【问题标题】:adding a hdfs datanode in a running spark/hadoop cluster在正在运行的 spark/hadoop 集群中添加 hdfs 数据节点
【发布时间】:2017-02-10 00:29:43
【问题描述】:


我有一个带有 1 个主节点和 2 个节点(worker + datanode)的 spark 集群。
我想添加另一个数据节点。 问题是,当我做hdfs dfs -setrep -R -w 2 时,结果是:

    1st datanode -> DFS Used%: 75.61%
    2nd datanode -> DFS Used%: 66.78%
    3rd datanode -> DFS Used%: 8.83%

您知道如何平衡 hdfs 中的块,以使每个块大约为 30 -> 33%?

谢谢

【问题讨论】:

  • 您应该设置三个副本,以便所有三个数据节点都可以使用。

标签: hadoop apache-spark hdfs


【解决方案1】:

运行balancer,集群平衡实用程序。这将重新平衡数据节点之间的数据。

hdfs balancer -threshold <threshold_value>

-threshold 确定磁盘容量的百分比。默认值为 10。

这指定每个 DataNode 的磁盘使用量必须或应该调整到集群整体使用量的 10% 以内。

此过程可能需要更长的时间,具体取决于要平衡的数据量,并且不会影响集群操作。

或者,如果选择添加其他节点,则执行 Datanode Commissioning

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2012-10-20
    • 1970-01-01
    • 2019-12-23
    • 1970-01-01
    • 2011-08-13
    • 1970-01-01
    • 1970-01-01
    • 2023-03-07
    相关资源
    最近更新 更多