Ubuntu和CentOS中分布式配置Hadoop-2.2.0

共计 12891 个字符，预计需要花费 33 分钟才能阅读完成。

一、准备工作

首先在每台 Linux 电脑上面安装好 JDK6 或其以上版本，并设置好 JAVA_HOME 等，测试一下 java、javac、jps 等命令是否可以在终端使用，具体可参考《Linux 中单机配置 Hadoop》http://www.linuxidc.com/Linux/2014-01/95802.htm 中的配置过程

二、设置静态 IP

注：如果是在虚拟中建立分布式环境，这一步就可以跳过了。

（1）CentOS 静态 IP 地址设置：

$sudo vim /etc/sysconfig/network-scripts/ifcfg-eth0

$sudo vim /etc/sysconfig/network-scripts/ifcfg-eth0

在里面添加下面语句：

IPADDR=192.168.1.108
NETMASK=255.255.255.0
NETWORK=192.168.1.1

IPADDR=192.168.1.108
NETMASK=255.255.255.0
NETWORK=192.168.1.1

其中，IPADDR 为你想要设置的静态 IP 地址。设置完成后，输入如下命令重启网络服务。

$ sudo service network restart

$ sudo service network restart

如果命令输入后结果一直都是 OK，则证明重启正常。输入如下命令测试一下，如果结果为你之前设置的 IP 地址。证明设置正确。

$ ifconfig

$ ifconfig

（2）、Ubuntu 静态 IP 地址设置步骤如下：

$ sudo vim /etc/network/interfaces

$ sudo vim /etc/network/interfaces

在里面添加：

auto eth0
iface eth0 inet static
address 192.168.1.108
netmask 255.255.255.0
gateway 192.168.1.1

auto eth0
iface eth0 inet static
address 192.168.1.108
netmask 255.255.255.0
gateway 192.168.1.1

同样需要让 IP 地址生效，输入

$ sudo /etc/init.d/networking restart

$ sudo /etc/init.d/networking restart

再输入 ifconfig 来检验 IP 设置是否生效。

三、设置 hostname

（1）Ubuntu 设置 hostname：

$ sudo vim /etc/hostname

$ sudo vim /etc/hostname

在里面添加自己需要取的 hostname，假设设置为 master。

查看设置是否生效，运行下面命令：

$ hostname

$ hostname

如果输出 master，说明配置生效。

（2）CentOS 设置 hostname：

$ sudo vim /etc/sysconfig/network

$ sudo vim /etc/sysconfig/network

将里面的 HOSTNAME 修改为你想要的 hostname，假设设置为 master

HOSTNAME=master

查看设置是否生效，运行下面命令

$ hostname

$ hostname

如果输出 master，说明配置生效。

四、设置 /etc/hosts

这一步是为了让各机器都能使用 hostname 通信，而不是用 IP 地址。我安装了三台 CentOS 虚拟机。IP 地址分别为 192.168.1.108、192.168.1.110、192.168.1.111，对应的 hostname 分别设置为 master、node、slave。在各台机器上分别运行如下命令（ubuntu 和 centos 一样）：

$ sudo vim /etc/hosts

$ sudo vim /etc/hosts

在里面添加以下语句

192.168.1.108 master
192.168.1.110 node
192.168.1.111 slave

192.168.1.108 master
192.168.1.110 node
192.168.1.111 slave

注，如果发现 hosts 文件中有 127.0.1.1 或者除了 127.0.0.1 之外的其他内容，将他们删除，否则之后的 hadoop 操作有可能会出现错误（比如：Hadoop Datanodes cannot find NameNode）。

在每个机器上使用 ping 命令看能否 ping 通其他机器。如果能 ping 通，则证明配置正确。

相关阅读：

Ubuntu 13.04 上搭建 Hadoop 环境 http://www.linuxidc.com/Linux/2013-06/86106.htm

Ubuntu 12.10 +Hadoop 1.2.1 版本集群配置 http://www.linuxidc.com/Linux/2013-09/90600.htm

Ubuntu 上搭建 Hadoop 环境（单机模式 + 伪分布模式）http://www.linuxidc.com/Linux/2013-01/77681.htm

Ubuntu 下 Hadoop 环境的配置 http://www.linuxidc.com/Linux/2012-11/74539.htm

单机版搭建 Hadoop 环境图文教程详解 http://www.linuxidc.com/Linux/2012-02/53927.htm

搭建 Hadoop 环境（在 Winodws 环境下用虚拟机虚拟两个 Ubuntu 系统进行搭建）http://www.linuxidc.com/Linux/2011-12/48894.htm

五、配置 SSH 无密码登录

可参考《Ubuntu 和 CentOS 配置 SSH 无密码登录》http://www.linuxidc.com/Linux/2014-01/95800.htm，做到 hostname 为 master 的机器能 ssh 无密码登录其他机器。

六、下载 Hadoop-2.2.0

$ cd /home/aaron
$ wget \
http://mirror.bit.edu.cn/apache/hadoop/common/hadoop-2.2.0/hadoop-2.2.0.tar.gz
$ tar -xf hadoop-2.2.0.tar.gz
$ cd hadoop-2.2.0

$ cd /home/aaron
$ wget http://mirror.bit.edu.cn/apache/hadoop/common/hadoop-2.2.0/hadoop-2.2.0.tar.gz
$ tar -xf hadoop-2.2.0.tar.gz
$ cd hadoop-2.2.0

七、配置 Hadoop 的环境变量

$ sudo vim /etc/profile

$ sudo vim /etc/profile

在 /etc/profile 文件的末尾加上以下配置

export HADOOP_DEV_HOME=/home/aaron/hadoop-2.2.0
export PATH=$PATH:$HADOOP_DEV_HOME/bin
export PATH=$PATH:$HADOOP_DEV_HOME/sbin
export HADOOP_MAPARED_HOME=${HADOOP_DEV_HOME}
export HADOOP_COMMON_HOME=${HADOOP_DEV_HOME}
export HADOOP_HDFS_HOME=${HADOOP_DEV_HOME}
export YARN_HOME=${HADOOP_DEV_HOME}
export HADOOP_CONF_DIR=${HADOOP_DEV_HOME}/etc/hadoop

export HADOOP_DEV_HOME=/home/aaron/hadoop-2.2.0
export PATH=$PATH:$HADOOP_DEV_HOME/bin
export PATH=$PATH:$HADOOP_DEV_HOME/sbin
export HADOOP_MAPARED_HOME=${HADOOP_DEV_HOME}
export HADOOP_COMMON_HOME=${HADOOP_DEV_HOME}
export HADOOP_HDFS_HOME=${HADOOP_DEV_HOME}
export YARN_HOME=${HADOOP_DEV_HOME}
export HADOOP_CONF_DIR=${HADOOP_DEV_HOME}/etc/hadoop

为了让刚刚的设置生效，运行下面的命令

$ sudo source /etc/profile

$ sudo source /etc/profile

在终端输入 hadoop 命令查看 Hadoop 的环境变量是否生效：

$ hadoop
Usage: hadoop [–config confdir] COMMAND
where COMMAND is one of:
fs run a generic filesystem user client
version print the version
jar <jar> run a jar file
checknative [-a|-h] check native hadoop and compression libraries
availability
distcp <srcurl> <desturl> copy file or directories recursively
archive -archiveName NAME -p <parent path> <src>* <dest> create
a hadoop archive
classpath prints the class path needed to get the
Hadoop jar and the required libraries
daemonlog get/set the log level for each daemon
or
CLASSNAME run the class named CLASSNAME
Most commands print help when invoked w/o parameters.

$ hadoop
Usage: hadoop [--config confdir] COMMAND
       where COMMAND is one of:
  fs                   run a generic filesystem user client
  version              print the version
  jar <jar>            run a jar file
  checknative [-a|-h]  check native hadoop and compression libraries 
                                                availability
  distcp <srcurl> <desturl> copy file or directories recursively
  archive -archiveName NAME -p <parent path> <src>* <dest> create 
                                             a hadoop archive
  classpath            prints the class path needed to get the
                       Hadoop jar and the required libraries
  daemonlog            get/set the log level for each daemon
 or
  CLASSNAME            run the class named CLASSNAME
 
Most commands print help when invoked w/o parameters.

如果显示上面的信息，说明环境变量生效了，如果显示不了，重启一下电脑试。

八、修改 Hadoop 的配置文件

修改 Hadoop 的 hadoop-env.sh 配置文件（在 hadoop-2.2.0/etc/hadoop/ 里面），设置 jdk 所在的路径：
在里面找到 JAVA_HOME，并将它的值设置为你电脑 jdk 所在的绝对路径

export JAVA_HOME=/usr/lib/jvm/java/jdk1.6.0_37

export JAVA_HOME=/usr/lib/jvm/java/jdk1.6.0_37

依次修改 core-site.xml、yarn-site.xml、mapred-site.xml 和 hdfs-site.xml 配置文件

1）修改 core-site.xml

<property>
<name>fs.default.name</name>
<value>hdfs://master:8020</value>
<final>true</final>
</property>
<property>
<name>hadoop.tmp.dir</name>
<value>/home/aaron/tmp/hadoop2.0</value>
</property>

<property>
  <name>fs.default.name</name>
  <value>hdfs://master:8020</value>
  <final>true</final>
</property>
<property>
  <name>hadoop.tmp.dir</name>
  <value>/home/aaron/tmp/hadoop2.0</value>
</property>

2）修改 yarn-site.xml

<property>
<name>yarn.resourcemanager.address</name>
<value>master:8032</value>
</property>
<property>
<name>yarn.resourcemanager.scheduler.address</name>
<value>master:8030</value>
</property>
<property>
<name>yarn.resourcemanager.resource-tracker.address</name>
<value>master:8031</value>
</property>
<property>
<name>yarn.resourcemanager.admin.address</name>
<value>master:8033</value>
</property>
<property>
<name>yarn.resourcemanager.webapp.address</name>
<value>master:8088</value>
</property>
<property>
<name>yarn.nodemanager.aux-services</name>
<value>mapreduce_shuffle</value>
</property>
<property>
<name>yarn.nodemanager.aux-services.mapreduce.shuffle.class</name>
<value>org.apache.hadoop.mapred.ShuffleHandler</value>
</property>

<property>
  <name>yarn.resourcemanager.address</name>
  <value>master:8032</value>
</property>
 
<property>
  <name>yarn.resourcemanager.scheduler.address</name>
  <value>master:8030</value>
</property>
 
<property>
  <name>yarn.resourcemanager.resource-tracker.address</name>
  <value>master:8031</value>
</property>
 
<property>
  <name>yarn.resourcemanager.admin.address</name>
  <value>master:8033</value>
</property>
 
<property>
  <name>yarn.resourcemanager.webapp.address</name>
  <value>master:8088</value>
</property>
 
<property> 
    <name>yarn.nodemanager.aux-services</name> 
    <value>mapreduce_shuffle</value> 
</property> 
  
<property> 
    <name>yarn.nodemanager.aux-services.mapreduce.shuffle.class</name> 
    <value>org.apache.hadoop.mapred.ShuffleHandler</value> 
</property>

注意：yarn.nodemanager.aux-services 的值是“mapreduce_shuffle”（在 hadoop-2.1-beta 中的值是“mapreduce.shuffle”）

3）修改 mapred-site.xml

<property>
<name>mapreduce.framework.name</name>
<value>yarn</value>
</property>
<property>
<name>mapred.system.dir</name>
<value>file:/home/aaron/hadoop/mapred/system</value>
<final>true</final>
</property>
<property>
<name>mapred.local.dir</name>
<value>file:/home/aaron/hadoop/mapred/local</value>
<final>true</final>
</property>

<property> 
    <name>mapreduce.framework.name</name> 
    <value>yarn</value> 
</property> 
  
<property> 
    <name>mapred.system.dir</name> 
    <value>file:/home/aaron/hadoop/mapred/system</value> 
    <final>true</final> 
</property> 
  
<property> 
    <name>mapred.local.dir</name> 
    <value>file:/home/aaron/hadoop/mapred/local</value> 
    <final>true</final> 
</property>

4）修改 hdfs-site.xml

<property>
<name>dfs.namenode.name.dir</name>
<value>file:/home/aaron/hadoop/dfs/name</value>
<final>true</final>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>file:/home/aaron/hadoop/dfs/data</value>
<final>true</final>
</property>
<property>
<name>dfs.replication</name>
<value>1</value>
</property>
<property>
<name>dfs.permissions</name>
<value>false</value>
</property>

<property>
    <name>dfs.namenode.name.dir</name>
    <value>file:/home/aaron/hadoop/dfs/name</value>
    <final>true</final>
</property>
  
<property>
    <name>dfs.datanode.data.dir</name>
    <value>file:/home/aaron/hadoop/dfs/data</value>
    <final>true</final>
</property>
<property>
    <name>dfs.replication</name>
    <value>1</value>
</property>
  
<property>
    <name>dfs.permissions</name>
    <value>false</value>
</property>

配置好 Hadoop 的相关东西之后，使用如下命令将 hadoop-2.2.0 整个文件夹分别拷贝到 node 和 slave 主机上去（注：设置都不需要改！）

$ scp -r ~/hadoop-2.2.0 aaron@node:~/
$ scp -r ~/hadoop-2.2.0 aaron@slave:~/

相关阅读：

Ubuntu 13.04 上搭建 Hadoop 环境 http://www.linuxidc.com/Linux/2013-06/86106.htm

Ubuntu 12.10 +Hadoop 1.2.1 版本集群配置 http://www.linuxidc.com/Linux/2013-09/90600.htm

Ubuntu 上搭建 Hadoop 环境（单机模式 + 伪分布模式）http://www.linuxidc.com/Linux/2013-01/77681.htm

Ubuntu 下 Hadoop 环境的配置 http://www.linuxidc.com/Linux/2012-11/74539.htm

单机版搭建 Hadoop 环境图文教程详解 http://www.linuxidc.com/Linux/2012-02/53927.htm

搭建 Hadoop 环境（在 Winodws 环境下用虚拟机虚拟两个 Ubuntu 系统进行搭建）http://www.linuxidc.com/Linux/2011-12/48894.htm

一、准备工作

二、设置静态 IP

注：如果是在虚拟中建立分布式环境，这一步就可以跳过了。

（1）CentOS 静态 IP 地址设置：

$sudo vim /etc/sysconfig/network-scripts/ifcfg-eth0

$sudo vim /etc/sysconfig/network-scripts/ifcfg-eth0

在里面添加下面语句：

IPADDR=192.168.1.108
NETMASK=255.255.255.0
NETWORK=192.168.1.1

IPADDR=192.168.1.108
NETMASK=255.255.255.0
NETWORK=192.168.1.1

其中，IPADDR 为你想要设置的静态 IP 地址。设置完成后，输入如下命令重启网络服务。

$ sudo service network restart

$ sudo service network restart

如果命令输入后结果一直都是 OK，则证明重启正常。输入如下命令测试一下，如果结果为你之前设置的 IP 地址。证明设置正确。

$ ifconfig

$ ifconfig

（2）、Ubuntu 静态 IP 地址设置步骤如下：

$ sudo vim /etc/network/interfaces

$ sudo vim /etc/network/interfaces

在里面添加：

auto eth0
iface eth0 inet static
address 192.168.1.108
netmask 255.255.255.0
gateway 192.168.1.1

auto eth0
iface eth0 inet static
address 192.168.1.108
netmask 255.255.255.0
gateway 192.168.1.1

同样需要让 IP 地址生效，输入

$ sudo /etc/init.d/networking restart

$ sudo /etc/init.d/networking restart

再输入 ifconfig 来检验 IP 设置是否生效。

三、设置 hostname

（1）Ubuntu 设置 hostname：

$ sudo vim /etc/hostname

$ sudo vim /etc/hostname

在里面添加自己需要取的 hostname，假设设置为 master。

查看设置是否生效，运行下面命令：

$ hostname

$ hostname

如果输出 master，说明配置生效。

（2）CentOS 设置 hostname：

$ sudo vim /etc/sysconfig/network

$ sudo vim /etc/sysconfig/network

将里面的 HOSTNAME 修改为你想要的 hostname，假设设置为 master

HOSTNAME=master

查看设置是否生效，运行下面命令

$ hostname

$ hostname

如果输出 master，说明配置生效。

四、设置 /etc/hosts

$ sudo vim /etc/hosts

$ sudo vim /etc/hosts

在里面添加以下语句

192.168.1.108 master
192.168.1.110 node
192.168.1.111 slave

192.168.1.108 master
192.168.1.110 node
192.168.1.111 slave

在每个机器上使用 ping 命令看能否 ping 通其他机器。如果能 ping 通，则证明配置正确。

相关阅读：

Ubuntu 13.04 上搭建 Hadoop 环境 http://www.linuxidc.com/Linux/2013-06/86106.htm

Ubuntu 12.10 +Hadoop 1.2.1 版本集群配置 http://www.linuxidc.com/Linux/2013-09/90600.htm

Ubuntu 上搭建 Hadoop 环境（单机模式 + 伪分布模式）http://www.linuxidc.com/Linux/2013-01/77681.htm

Ubuntu 下 Hadoop 环境的配置 http://www.linuxidc.com/Linux/2012-11/74539.htm

单机版搭建 Hadoop 环境图文教程详解 http://www.linuxidc.com/Linux/2012-02/53927.htm

搭建 Hadoop 环境（在 Winodws 环境下用虚拟机虚拟两个 Ubuntu 系统进行搭建）http://www.linuxidc.com/Linux/2011-12/48894.htm

九、关掉 master、node 和 slave 的防火墙

为了防止在 Hadoop 启动时遇到 java.net.NoRouteToHostException 异常，请关掉防火墙。

（1）对于 Ubuntu 关闭防火墙

$ sudo ufw disable

$ sudo ufw disable

如果你要防火墙可以运行：

$ sudo apt-get remove iptables

$ sudo apt-get remove iptables

（2）对于 CentOS 关闭防火墙
查看 iptables 状态：

$ sudo service iptables status

$ sudo service iptables status

iptables 开机自动启动：

开启：$ sudo chkconfig iptables on
关闭：$ sudo chkconfig iptables off

开启：$ sudo chkconfig iptables on
关闭：$ sudo chkconfig iptables off

iptables 关闭服务：

开启：$ sudo service iptables start
关闭：service iptables stop

开启：$ sudo service iptables start
关闭：service iptables stop

十、运行 hadoop-2.2.0
首先在 master 上面格式化一下 HDFS, 如下命令

$ hdfs namenode -format

$  hdfs namenode -format

在 master 中启动 namenode 和 resourcemanager

$ hadoop-daemon.sh start namenode
$ yarn-daemon.sh start resourcemanager

$ hadoop-daemon.sh start namenode
$ yarn-daemon.sh start resourcemanager

在 node 和 slave 中启动 datanode 和 nodemanager

$ hadoop-daemon.sh start datanode
$ yarn-daemon.sh start nodemanager

$ hadoop-daemon.sh start datanode
$ yarn-daemon.sh start nodemanager

检查 Hadoop 集群是否安装好了，在 master 上面运行 jps，如果有 NameNode、ResourceManager 二个进程，说明 master 安装好了。

1）查看 jps

$ jps
2016 NameNode
2602 ResourceManager

$ jps
2016 NameNode
2602 ResourceManager

在 node（slave）上面运行 jps，如果有 DataNode、NodeManager 二个进程，说明 node（node1）安装好了。

$ jps
7889 DataNode
7979 NodeManager

$ jps
7889 DataNode
7979 NodeManager

2）检查以下两个页面是否能打开

http://master:50070/dfshealth.jsp
http://master:8088/cluster/nodes

3）运行以下 hdfs 命令

hadoop fs -mkdir /input
hadoop fs -put NOTICE.txt /test/input/
hadoop fs -put README.txt /test/input/
hadoop fs -ls /input
hadoop fs -cat /input/NOTICE.txt

hadoop fs -mkdir /input
hadoop fs -put NOTICE.txt /test/input/
hadoop fs -put README.txt /test/input/
hadoop fs -ls /input
hadoop fs -cat /input/NOTICE.txt

4）运行 mapreduce job