【问题标题】:hadoop MapReduce job on single node Vs Multi node单节点与多节点上的hadoop MapReduce作业
【发布时间】:2015-01-10 19:47:44
【问题描述】:

嘿,我已经为 map reduce 编写了我的第一个 Java 代码。 我已经在单个节点上运行它。

但我不确定它需要进行哪些更改才能与多节点一起使用 如果有的话,有人可以指导我吗?

【问题讨论】:

    标签: hadoop mapreduce


    【解决方案1】:

    一个好的起点是关注this tutorial

    你应该看看的要点是:

    • /etc/hosts文件每个节点,在其中添加所有节点的ip(还要确保您可以在没有密码的情况下将ssh添加到每个节点)
    • $HADOOP_HOME/conf/masters$HADOOP_HOME/conf/slaves 文件在主节点中,您可以在其中添加相应的节点
    • 增加减少任务的数量,以防它为 1 并且您的算法支持。您可以通过调用 setNumReduceTasks(int n) 方法在您的 main 方法中执行此操作(可以在 here 找到有关设置的说明)。
    • 将复制因子设置为 1(默认为 3),以利用数据局部性(数据复制到更多节点,因此可以节省一些数据传输)。
    • 按照提供的教程中的说明设置*-site.xml 文件。

    当然,您应该在更改之前停止集群并在之后重新启动。

    【讨论】:

    • 那么,改变reduce任务的数量是我现在唯一能想到的
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2014-04-09
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多