Hadoop2.2.0使用笔记总结（一）

最新推荐文章于 2021-03-21 19:04:01 发布

过云雨后

最新推荐文章于 2021-03-21 19:04:01 发布

阅读量542

点赞数

分类专栏： Hadoop2调优

本文链接：https://blog.csdn.net/guoyunyuhou/article/details/44590913

版权

Hadoop2调优专栏收录该内容

9 篇文章 0 订阅

订阅专栏

1、执行Mapreduce程序卡住

安装完毕后执行wordcount程序时，mapreduce任务卡住，注意修改hosts文件，将ip地址映射到主机名

2、非root用户对文件是否有读写权限？

<name>dfs.permissions</name>

<value>false</value>

</property>

3、eclipse执行mapReduce程序报空指针

Eclipse运行mapreduce需要配置hadoop环境变量，替换bin包

4、hadoop2.2.0配置HA

HA集群需要使用nameservice ID区分一个HDFS集群。另外，HA中还要使用一个词，叫做NameNode ID。同一个集群中的不同NameNode，使用不同的NameNode ID区分。为了支持所有NameNode使用相同的配置文件，因此在配置参数中，需要把“nameservice ID”作为NameNode ID的前缀。

HA配置内容是在文件hdfs-site.xml中的。下面介绍关键配置项。

dfs.nameservices 命名空间的逻辑名称。如果使用HDFS Federation，可以配置多个命名空间的名称，使用逗号分开即可。

<name>dfs.nameservices</name>

<value>mycluster</value>

</property>

dfs.ha.namenodes.[nameservice ID] 命名空间中所有NameNode的唯一标示名称。可以配置多个，使用逗号分隔。该名称是可以让DataNode知道每个集群的所有NameNode。当前，每个集群最多只能配置两个NameNode。

<name>dfs.ha.namenodes.mycluster</name>

</property>

dfs.namenode.rpc-address.[nameservice ID].[name node ID] 每个namenode监听的RPC地址。如下所示

<name>dfs.namenode.rpc-address.mycluster.nn1</name>

<value>machine1.example.com:8020</value>

</property>

<name>dfs.namenode.rpc-address.mycluster.nn2</name>

<value>machine2.example.com:8020</value>

</property>

dfs.namenode.http-address.[nameservice ID].[name node ID] 每个namenode监听的http地址。如下所示

<name>dfs.namenode.http-address.mycluster.nn1</name>

<value>machine1.example.com:50070</value>

</property>

<name>dfs.namenode.http-address.mycluster.nn2</name>

<value>machine2.example.com:50070</value>

</property>

如果启用了安全策略，也应该对每个namenode配置htts-address信息，与此类似。

dfs.namenode.shared.edits.dir 这是NameNode读写JNs组的uri。通过这个uri，NameNodes可以读写edit log内容。URI的格式"qjournal://host1:port1;host2:port2;host3:port3/journalId"。这里的host1、host2、host3指的是Journal Node的地址，这里必须是奇数个，至少3个；其中journalId是集群的唯一标识符，对于多个联邦命名空间，也使用同一个journalId。配置如下

<name>dfs.namenode.shared.edits.dir</name>

<value>qjournal://node1.example.com:8485;node2.example.com:8485;node3.example.com:8485/mycluster</value>

</property>

dfs.client.failover.proxy.provider.[nameservice ID] 这里配置HDFS客户端连接到Active NameNode的一个java类。

<name>dfs.client.failover.proxy.provider.mycluster</name>

<value>org.apache.Hadoop.hdfs.server.namenode.ha.ConfiguredFailoverProxyProvider</value>

</property>

dfs.ha.fencing.methods配置active namenode出错时的处理类。当active namenode出错时，一般需要关闭该进程。处理方式可以是ssh也可以是shell。

如果使用ssh，配置如下

<name>dfs.ha.fencing.methods</name>

<value>sshfence</value>

</property>

<name>dfs.ha.fencing.ssh.private-key-files</name>

<value>/home/exampleuser/.ssh/id_rsa</value>

</property>

这种方法配置简单，推荐使用。

fs.defaultFS 客户端连接HDFS时，默认的路径前缀。如果前面配置了nameservice ID的值是mycluster，那么这里可以配置为授权信息的一部分。

可以在core-site.xml中配置如下

<name>fs.defaultFS</name>

<value>hdfs://mycluster</value>

</property>

dfs.journalnode.edits.dir 这是JournalNode进程保持逻辑状态的路径。这是在linux服务器文件的绝对路径。

配置如下

<name>dfs.journalnode.edits.dir</name>

<value>/path/to/journal/node/local/data</value>

</property>

部署

以上配置完成后，就可以启动JournalNode进程了。在各个JournalNode机器上执行命令“Hadoop-daemon.sh journalnode”。

如果是一个新的HDFS集群，还要首先执行格式化命令“hdfs namenode -format”，紧接着启动本NameNode进程。

如果存在一个已经格式化过的NameNode，并且已经启动了。那么应该把该NameNode的数据同步到另一个没有格式化的NameNode。在未格式化过的NameNode上执行命令“hdfs namenode -bootstrapStandby”。

如果是把一个非HA集群转成HA集群，应该运行命令“hdfs –initializeSharedEdits”，这会初始化JournalNode中的数据。

做了这些事情后，就可以启动两个NameNode了。启动成功后，通过web页面观察两个NameNode的状态，都是standby。

下面执行命令“hdfs haadmin -failover --forcefence serviceId serviceId2”。就会把NameNode的状态进行安全的切换。其中后面一个会变为active状态。这时候再通过web页面观察就能看到正确结果了。

5、如何实现namenode节点自动切换

http://www.it165.net/admin/html/201404/2728.html

当NameNode发生故障时，他们的数据如何保持一致：在这里，2个NameNode的数据其实是实时共享的。新HDFS采用了一种共享机制，JournalNode集群或者NFS进行共享。NFS是操作系统层面的，JournalNode是hadoop层面的，我们这里使用JournalNode集群进行数据共享。

如何实现NameNode的自动切换：这就需要使用ZooKeeper集群进行选择了。HDFS集群中的两个NameNode都在ZooKeeper中注册，当active状态的NameNode出故障时，ZooKeeper能检测到这种情况，它就会自动把standby状态的NameNode切换为active状态。

zk集群格式化界面

执行自动切换namenode的zk进程

过云雨后

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Hadoop2.2.0使用笔记总结（一）

1、执行Mapreduce程序卡住安装完毕后执行wordcount程序时，mapreduce任务卡住，注意修改hosts文件，将ip地址映射到主机名2、非root用户对文件是否有读写权限？ dfs.permissions false 3、eclipse执行mapReduce程序报空指针Eclipse运行mapreduce需要配置hadoop环
复制链接

扫一扫