Hadoop运行模式之完全分布式运行模式

分析:

        1)准备3台客户机(关闭防火墙、静态ip、主机名称

        2)安装JDK

        3)配置环境变量

        4)安装Hadoop

        5)配置环境变量

以上5步骤请参看https://blog.csdn.net/m0_37294838/article/details/89989300

       6)配置集群

        7)单点启动

        8)配置ssh

        9)群起并测试集群

 

编写集群分发脚本xsync

以下是拷贝文件到另一系统的操作方式,一共有三种,推荐用第三种,脚本方式

方式一:

1.    scp(secure copy)安全拷贝

        (1)scp定义:

scp可以实现服务器与服务器之间的数据拷贝。(from server1 to server2)

        (2)基本语法                     

scp    -r          $pdir/$fname              $user@hadoop$host:$pdir/$fname

命令   递归       要拷贝的文件路径/名称    目的用户@主机:目的路径/名称

(3)案例实操

(a)在hadoop101上,将hadoop101中/opt/module目录下的软件拷贝到hadoop102上。

   [atguigu@hadoop101 /]$ scp -r /opt/module  root@hadoop102:/opt/module

(b)在hadoop103上,将hadoop101服务器上的/opt/module目录下的软件拷贝到hadoop103上。

 [atguigu@hadoop103 opt]$sudo scp -r atguigu@hadoop101:/opt/module root@hadoop103:/opt/module

(c)在hadoop103上操作将hadoop101中/opt/module目录下的软件拷贝到hadoop104上。

  [atguigu@hadoop103 opt]$ scp -r atguigu@hadoop101:/opt/module root@hadoop104:/opt/module

注意:拷贝过来的/opt/module目录,别忘了在hadoop102hadoop103hadoop104上修改所有文件的,所有者和所有者组。sudo chown atguigu:atguigu -R /opt/module

 

(d)将hadoop101中/etc/profile文件拷贝到hadoop102的/etc/profile上。

[atguigu@hadoop101 ~]$ sudo scp /etc/profile root@hadoop102:/etc/profile

(e)将hadoop101中/etc/profile文件拷贝到hadoop103的/etc/profile上。

 [atguigu@hadoop101 ~]$ sudo scp /etc/profile root@hadoop103:/etc/profile

(f)将hadoop101中/etc/profile文件拷贝到hadoop104的/etc/profile上。

 [atguigu@hadoop101 ~]$ sudo scp /etc/profile root@hadoop104:/etc/profile

注意:拷贝过来的配置文件别忘了source一下/etc/profile,。

方式二:

2.    rsync 远程同步工具

      rsync主要用于备份和镜像。具有速度快、避免复制相同内容和支持符号链接的优点。

     rsyncscp区别:rsync做文件的复制要比scp的速度快,rsync只对差异文件做更新。scp是把所有文件都复制过去。

        (1)基本语法

                rsync    -av       $pdir/$fname              $user@hadoop$host:$pdir/$fname

               命令   选项参数   要拷贝的文件路径/名称    目的用户@主机:目的路径/名称

          选项参数说明

选项

功能

-a

归档拷贝

-v

显示复制过程

(2)案例实操

                (a)把hadoop101机器上的/opt/software目录同步到hadoop102服务器的root用户下的/opt/目录

                           [atguigu@hadoop101 opt]$ rsync -av /opt/software/ hadoop102:/opt/software

3.    xsync集群分发脚本

(1)需求:循环复制文件到所有节点的相同目录下

        (2)需求分析:

             (a)rsync命令原始拷贝:

                       rsync  -av     /opt/module                 root@hadoop103:/opt/

               b)期望脚本:

                xsync要同步的文件名称

                c)说明:在/home/atguigu/bin这个目录下存放的脚本,atguigu用户可以在系统任何地方直接执行。

 

方式三(推荐):

(3)脚本实现

(a)在/home/atguigu目录下创建bin目录,并在bin目录下xsync创建文件,文件内容如下:

        [atguigu@hadoop102 ~]$ mkdir bin

         [atguigu@hadoop102 ~]$ cd bin/

         [atguigu@hadoop102 bin]$ touch xsync

         [atguigu@hadoop102 bin]$ vi xsync

在该文件中编写如下代码

#!/bin/bash

#1 获取输入参数个数,如果没有参数,直接退出

pcount=$#

if ((pcount==0)); then

echo no args;

exit;

fi

#2 获取文件名称

p1=$1

fname=`basename $p1`

echo fname=$fname

#3 获取上级目录到绝对路径

pdir=`cd -P $(dirname $p1); pwd`

echo pdir=$pdir

#4 获取当前用户名称

user=`whoami`

#5 循环

for((host=103; host<105; host++)); do

        echo ------------------- hadoop$host --------------

        rsync -av $pdir/$fname $user@hadoop$host:$pdir

done

(b)修改脚本 xsync 具有执行权限

[atguigu@hadoop102 bin]$ chmod 777 xsync

(c)调用脚本形式:xsync 文件名称

[atguigu@hadoop102 bin]$ xsync /home/atguigu/bin

注意:如果将xsync放到/home/atguigu/bin目录下仍然不能实现全局使用,可以将xsync移动到/usr/local/bin目录下。

 

集群配置

1.    集群部署规划

 

hadoop102

hadoop103

hadoop104

HDFS

 

NameNode

DataNode

 

DataNode

SecondaryNameNode

DataNode

YARN

 

NodeManager

ResourceManager

NodeManager

 

NodeManager

2.    配置集群

(1)核心配置文件

           配置core-site.xml

                 [atguigu@hadoop102 hadoop]$ vi core-site.xml

                   在该文件中编写如下配置

<!-- 指定HDFS中NameNode的地址 -->

<property>

     <name>fs.defaultFS</name>

      <value>hdfs://hadoop102:9000</value>

</property>

<!-- 指定Hadoop运行时产生文件的存储目录 -->

<property>

     <name>hadoop.tmp.dir</name>

     <value>/opt/module/hadoop-2.7.2/data/tmp</value>

</property>

        (2)HDFS配置文件             

   配置hadoop-env.sh

  [atguigu@hadoop102 hadoop]$ vi hadoop-env.sh

   export JAVA_HOME=/opt/module/jdk1.8.0_144

   配置hdfs-site.xml

[atguigu@hadoop102 hadoop]$ vi hdfs-site.xml

在该文件中编写如下配置

<property>

     <name>dfs.replication</name>

     <value>3</value>

</property>

<!-- 指定Hadoop辅助名称节点主机配置 -->

<property>

      <name>dfs.namenode.secondary.http-address</name>

      <value>hadoop104:50090</value>

</property>

(3)YARN配置文件

        配置yarn-env.sh     

 [atguigu@hadoop102 hadoop]$ vi yarn-env.sh

   export JAVA_HOME=/opt/module/jdk1.8.0_144

      配置yarn-site.xml

 [atguigu@hadoop102 hadoop]$ vi yarn-site.xml

在该文件中增加如下配置

<!-- Reducer获取数据的方式 -->

<property>

     <name>yarn.nodemanager.aux-services</name>

     <value>mapreduce_shuffle</value>

</property>

<!-- 指定YARN的ResourceManager的地址 -->

<property>

     <name>yarn.resourcemanager.hostname</name>

     <value>hadoop103</value>

</property>
 <!-- 日志聚集功能使能 -->
 <property>
    <name>yarn.log-aggregation-enable</name>
    <value>true</value>
  </property>

   <!-- 日志保留时间设置7天 -->
   <property>
         <name>yarn.log-aggregation.retain-seconds</name>
            <value>604800</value>
   </property>

(4)MapReduce配置文件

      配置mapred-env.sh   

   [atguigu@hadoop102 hadoop]$ vi mapred-env.sh

      export JAVA_HOME=/opt/module/jdk1.8.0_144

      配置mapred-site.xml   

   [atguigu@hadoop102 hadoop]$ cp mapred-site.xml.template mapred-site.xml

    [atguigu@hadoop102 hadoop]$ vi mapred-site.xml

在该文件中增加如下配置

<!-- 指定MR运行在Yarn上 -->

<property>

     <name>mapreduce.framework.name</name>

     <value>yarn</value>

</property>
<!-- 历史服务器端地址 -->
<property>
      <name>mapreduce.jobhistory.address</name>
     <value>hadoop104:10020</value>
</property>
    <!-- 历史服务器web端地址 -->
<property>
      <name>mapreduce.jobhistory.webapp.address</name>
        <value>hadoop104:19888</value>
 </property>

3.在集群上分发配置好的Hadoop配置文件

  [atguigu@hadoop102 hadoop]$ xsync /opt/module/hadoop-2.7.2/

4.查看文件分发情况

[atguigu@hadoop103 hadoop]$ cat /opt/module/hadoop-2.7.2/etc/hadoop/core-site.xml

 

 集群单点启动

(1)如果集群是第一次启动,需要格式化NameNode

  [atguigu@hadoop102 hadoop-2.7.2]$ hdfs namenode -format

(2)在hadoop102上启动NameNode   

[atguigu@hadoop102 hadoop-2.7.2]$ hadoop-daemon.sh start namenode

[atguigu@hadoop102 hadoop-2.7.2]$ jps

3461 NameNode

(3)在hadoop102、hadoop103以及hadoop104上分别启动DataNode   

[atguigu@hadoop102 hadoop-2.7.2]$ hadoop-daemon.sh start datanode

[atguigu@hadoop102 hadoop-2.7.2]$ jps

  3461 NameNode
  3608 Jps
  3561 DataNode

[atguigu@hadoop103 hadoop-2.7.2]$ hadoop-daemon.sh start datanode
[atguigu@hadoop103 hadoop-2.7.2]$ jps
    3190 DataNode
    3279 Jps

[atguigu@hadoop104 hadoop-2.7.2]$ hadoop-daemon.sh start datanode
[atguigu@hadoop104 hadoop-2.7.2]$ jps
    3237 Jps
    3163 DataNode

4)思考:每次都一个一个节点启动,如果节点数增加到1000个怎么办?

        早上来了开始一个一个节点启动,到晚上下班刚好完成,下班?

 

SSH无密登录配置

1.    配置ssh

(1)基本语法

        ssh另一台电脑的ip地址

(2)ssh连接时出现Host key verification failed的解决方法 

   [atguigu@hadoop102 opt] $ ssh 192.168.1.103

       The authenticity of host '192.168.1.103 (192.168.1.103)' can't be established.

      RSA key fingerprint is cf:1e:de:d7:d0:4c:2d:98:60:b4:fd:ae:b1:2d:ad:06.

      Are you sure you want to continue connecting (yes/no)?

      Host key verification failed.

   (3)解决方案如下:直接输入yes

2.    无密钥配置

(1)免密登录原理,如图

(2)生成公钥和私钥:

  [atguigu@hadoop102 .ssh]$ ssh-keygen -t rsa

           然后敲(三个回车),就会生成两个文件id_rsa(私钥)、id_rsa.pub(公钥)

(3)将公钥拷贝到要免密登录的目标机器上

[atguigu@hadoop102 .ssh]$ ssh-copy-id hadoop102
atguigu@hadoop102 .ssh]$ ssh-copy-id hadoop103
[atguigu@hadoop102 .ssh]$ ssh-copy-id hadoop104

注意:

还需要在hadoop102上采用root账号,配置一下无密登录到hadoop102hadoop103hadoop104

还需要在hadoop103上采用atguigu账号配置一下无密登录到hadoop102hadoop103hadoop104服务器上。

3.    .ssh文件夹下(~/.ssh)的文件功能解释

known_hosts

记录ssh访问过计算机的公钥(public key)

id_rsa

生成的私钥

id_rsa.pub

生成的公钥

authorized_keys

存放授权过得无密登录服务器公钥

 

 群起集群

1.    配置slaves

/opt/module/hadoop-2.7.2/etc/hadoop/slaves
[atguigu@hadoop102 hadoop]$ vi slaves

在该文件中增加如下内容:

hadoop102

hadoop103

hadoop104

注意:该文件中添加的内容结尾不允许有空格,文件中不允许有空行。

同步所有节点配置文件

[atguigu@hadoop102 hadoop]$ xsync slaves

2.    启动集群

        (1)如果集群是第一次启动,需要格式化NameNode(注意格式化之前,一定要先停止上次启动的所有namenodedatanode进程,然后再删除datalog数据)

  [atguigu@hadoop102 hadoop-2.7.2]$ bin/hdfs namenode -format

2)启动HDFS 

[atguigu@hadoop102 hadoop-2.7.2]$ sbin/start-dfs.sh
[atguigu@hadoop102 hadoop-2.7.2]$ jps
    4166 NameNode
    4482 Jps
    4263 DataNode

[atguigu@hadoop103 hadoop-2.7.2]$ jps
    3218 DataNode
    3288 Jps

[atguigu@hadoop104 hadoop-2.7.2]$ jps
    3221 DataNode
    3283 SecondaryNameNode
    3364 Jps

(3)启动YARN

[atguigu@hadoop103 hadoop-2.7.2]$ sbin/start-yarn.sh

注意:NameNodeResourceManger如果不是同一台机器,不能在NameNode上启动 YARN,应该在ResouceManager所在的机器上启动YARN

(4)Web端查看SecondaryNameNode

(a)浏览器中输入:http://hadoop104:50090/status.html

                (b)查看SecondaryNameNode信息

 

3.    集群基本测试

(1)上传文件到集群

          上传小文件

[atguigu@hadoop102 hadoop-2.7.2]$ hdfs dfs -mkdir -p /user/atguigu/input
[atguigu@hadoop102 hadoop-2.7.2]$ hdfs dfs -put wcinput/wc.input /user/atguigu/input

          上传大文件

[atguigu@hadoop102 hadoop-2.7.2]$ bin/hadoop fs -put
/opt/software/hadoop-2.7.2.tar.gz  /user/atguigu/input

(2)上传文件后查看文件存放在什么位置

(a)查看HDFS文件存储路径

[atguigu@hadoop102 subdir0]$ pwd

/opt/module/hadoop-2.7.2/data/tmp/dfs/data/current/BP-938951106-192.168.10.107-1495462844069/current/finalized/subdir0/subdir0

(b)查看HDFS在磁盘存储文件内容 

     [atguigu@hadoop102 subdir0]$ cat blk_1073741825

      hadoop yarn

      hadoop mapreduce

       atguigu

       atguigu

(3)拼接   

    -rw-rw-r--. 1 atguigu atguigu 134217728 5月  23 16:01 blk_1073741836

    -rw-rw-r--. 1 atguigu atguigu   1048583 5月  23 16:01 blk_1073741836_1012.meta

    -rw-rw-r--. 1 atguigu atguigu  63439959 5月  23 16:01 blk_1073741837

    -rw-rw-r--. 1 atguigu atguigu    495635 5月  23 16:01 blk_1073741837_1013.meta

    [atguigu@hadoop102 subdir0]$ cat blk_1073741836>>tmp.file

    [atguigu@hadoop102 subdir0]$ cat blk_1073741837>>tmp.file

    [atguigu@hadoop102 subdir0]$ tar -zxvf tmp.file

(4)下载 

  [atguigu@hadoop102 hadoop-2.7.2]$ bin/hadoop fs -get

   /user/atguigu/input/hadoop-2.7.2.tar.gz ./

 

集群启动/停止方式总结

1.    各个服务组件逐一启动/停止

        (1)分别启动/停止HDFS组件

                 hadoop-daemon.sh  start / stop  namenode / datanode / secondarynamenode

        (2)启动/停止YARN

                 yarn-daemon.sh  start / stop  resourcemanager / nodemanager

2.    各个模块分开启动/停止(配置ssh是前提)常用

        (1)整体启动/停止HDFS

                 start-dfs.sh   /  stop-dfs.sh

        (2)整体启动/停止YARN

                 start-yarn.sh  /  stop-yarn.sh

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值