【问题标题】:Installing and configuring a multi-node Hadoop cluster安装和配置多节点 Hadoop 集群
【发布时间】:2017-10-01 05:12:59
【问题描述】:

我是大数据系统的新手,已经完成了一些 Coursera 认证。我计划使用 4 台商品级 PC 拥有自己的个人 Hadoop 集群。目前都运行 Windows,但我可以在它们上安装 Linux。我在互联网上搜索了很多设置过程,但没有找到(发现很多可以在 AWS 上旋转)。此时,我不局限于任何平台,而是希望所有技术都是免费的\开源的。使用 4 台 PC,我可以拥有 1 个主节点和其他 3 个数据节点。希望了解如何旋转这个裸机 Hadoop 集群的详细步骤(至少是大致的轮廓)。

【问题讨论】:

  • 如果您想要一个简单的设置,您可以使用 Apache Ambari(来自 Hortonworks 或 MapR)或使用 Cloudera Manager
  • 感谢 Cricket_007。在多节点集群上安装 Cloudera 是否免费供个人使用?
  • Cloudera Express 是免费版本。 cloudera.com/documentation/enterprise/latest/topics/…

标签: hadoop installation cluster-computing


【解决方案1】:

所以你想在 4 节点集群上安装 hadoop 设置!

要求:1主3从(多节点集群安装hadoop设置)


第 1 步:摆脱窗户。目前 Hadoop 可用于 Linux 机器。您可以拥有 ubuntu 14.04 或更高版本(或 CentOS、Redhat 等)

第 2 步:安装和设置 Java $ sudo apt-get install python-software-properties $ sudo add-apt-repository ppa:ferramroberto/java $ sudo apt-get 更新 $ sudo apt-get install sun-java6-jdk

# Select Sun's Java as the default on your machine.
# See 'sudo update-alternatives --config java' for more information.    
#
$ sudo update-java-alternatives -s java-6-sun

步骤 3:在 .bashrc 文件中设置路径(使用文本编辑器(vi/nano)打开此文件并附加以下文本)

export JAVA_HOME=/usr/local/jdk1.7.0_71
export PATH=PATH:$JAVA_HOME/bin

第 4 步:添加专用用户(虽然不是必需的,但建议这样做)

# useradd hadoop 
# passwd hadoop

第 5 步:编辑所有节点上 /etc/ 文件夹中的 hosts 文件,指定每个系统的 IP 地址及其主机名。(使用vi /etc/hosts 打开文件并在下面附加文本--

<ip address of master node> hadoop-master 
<ip address of slave node 1> hadoop-slave-1 
<ip address of slave node 2> hadoop-slave-2
<ip address of slave node 3> hadoop-slave-3

第 6 步:在每个节点中设置 ssh,以便它们可以在不提示输入密码的情况下相互通信。

$ su hadoop
$ ssh-keygen -t rsa 
$ ssh-copy-id -i ~/.ssh/id_rsa.pub hadoop@hadoop-master 
$ ssh-copy-id -i ~/.ssh/id_rsa.pub hadoop_tp1@hadoop-slave-1 
$ ssh-copy-id -i ~/.ssh/id_rsa.pub hadoop_tp2@hadoop-slave-2
$ ssh-copy-id -i ~/.ssh/id_rsa.pub hadoop_tp3@hadoop-slave-3
$ chmod 0600 ~/.ssh/authorized_keys 
$ exit

有关 SSH 的更多信息,请访问:[https://www.ssh.com/ssh/][1]

第 7 步:在主服务器中下载并安装 Hadoop。

# mkdir /opt/hadoop 
# cd /opt/hadoop/ 
# wget http://apache.mesi.com.ar/hadoop/common/hadoop-1.2.1/hadoop-
  1.2.0.tar.gz 
# tar -xzf hadoop-1.2.0.tar.gz 
# mv hadoop-1.2.0 hadoop
# chown -R hadoop /opt/hadoop 
# cd /opt/hadoop/hadoop/

到此安装完毕!

下一步是:配置 Hadoop

第1步:打开core-site.xml并编辑如下:

<configuration>
<property> 
  <name>fs.default.name</name> 
  <value>hdfs://hadoop-master:9000/</value> 
</property> 
<property> 
  <name>dfs.permissions</name> 
  <value>false</value> 
</property> 
</configuration>

第二步:打开 hdfs-site.xml 并编辑如下:

<configuration>
<property> 
  <name>dfs.data.dir</name> 
  <value>/opt/hadoop/hadoop/dfs/name/data</value> 
  <final>true</final> 
</property> 

<property> 
  <name>dfs.name.dir</name> 
  <value>/opt/hadoop/hadoop/dfs/name</value> 
  <final>true</final> 
</property> 
 <property> 
  <name>dfs.name.dir</name> 
  <value>/opt/hadoop/hadoop/dfs/name</value> 
  <final>true</final> 
</property> 

<property> 
  <name>dfs.replication</name> 
  <value>3</value> 
</property> 
</configuration>

第 3 步:打开 mapred-site.xml 并编辑 --

<configuration>
<property> 
  <name>mapred.job.tracker</name> 
  <value>hadoop-master:9001</value> 
</property> 
</configuration>

第 4 步:在 hadoop-env.sh 中追加文本

export JAVA_HOME=/opt/jdk1.7.0_17 export 
HADOOP_OPTS=Djava.net.preferIPv4Stack=true export 
HADOOP_CONF_DIR=/opt/hadoop/hadoop/conf

第 5 步:配置主服务器 --

$ vi etc/hadoop/masters 
hadoop-master

第 5 步:也将其安装在从节点上 --

# su hadoop 
$ cd /opt/hadoop 
$ scp -r hadoop hadoop-slave-1:/opt/hadoop 
$ scp -r hadoop hadoop-slave-2:/opt/hadoop
$ scp -r hadoop hadoop-slave-3:/opt/hadoop

第 6 步:配置从站 --

$ vi etc/hadoop/slaves
hadoop-slave-1 
hadoop-slave-2
hadoop-slave-3

第 7 步:格式化节点(仅一次,否则所有数据将永久丢失)

# su hadoop 
$ cd /opt/hadoop/hadoop 
$ bin/hadoop namenode –format

一切准备就绪!

您可以按如下方式启动服务--

$ cd $HADOOP_HOME/sbin
$ start-all.sh

【讨论】:

  • 伟大的 PyCodoop。感谢您的详细回答。我将从这里开始
  • 为什么要使用几年前的 Hadoop 1.2?
  • 另外,您使用的是 Java 6,然后将 Java home 设置为 Java 7。两者都已停产……您需要更新您的笔记
  • 感谢您的关注。在基于 linux 的系统上升级/更新任何东西都没什么大不了的。我专注于安装/配置部分。
猜你喜欢
  • 2016-05-17
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多