夏天小厨
前言
大数据这个概念,说的通俗点就是对海量数据的处理分析。据不完全统计,世界百分之九十的数据都由近几年产生,且不说海量数据的ETL,单从数据的存储和数据展现的实时性,传统的单机就已经无法满足实际场景的需要例如很多OLAP系统。由此引出了Hadoop,Hadoop是一个开源框架,它允许在整个集群使用简单编程模型计算机的分布式环境存储并处理大数据。它的目的是从单一的服务器到上千台机器的扩展,每一个台机都可以提供本地计算和存储。简单说Hadoop提供了两个功能:提供海量数据的存储服务;提供分析海量数据的编程框架及运行平台,我们在研究Hadoop时应重点关注HDFS、MapReduce以及新一代的资源调度管理集群YARN。
本博文属于Hadoop入门教程,读者如对Hadoop生态圈其他技术感兴趣,可查看夏天小厨的其他博文。此次搭建的Hadoop集群所采用的组件为Java 1.8 + CentOS 6.3 + Hadoop 2.6.5。
Hadoop集群搭建
1、设置三台虚拟机,一台为master,另外两台为slave1、slave3。这样做的目的即在于,master是主节点,两台slave为子节点。实现主从分离,分布式结构。
2、保证三台虚拟机的网络互通。通过ifconfig命令,检查各本机的IP地址;su命令切换到root用户下 su root。
需要将三台机器IP配置到主机名列表里面,输入命令: vi /etc/hosts
192.168.83.131 master
192.168.83.130 slave1
192.168.83.133 slave3
3、为保证三台虚拟机能够通信,关闭防火墙。有两种方式,第一种setup命令;输入命令:setup
第二种方式通过iptables关闭。输入关闭命令: service iptables stop
永久关闭防火墙:chkconfig iptables off
运行完成后查看防火墙关闭状态 输入命令:service iptables status
4、第四步,为了容易分辨哪台集群是master,哪台机器是slave,把hostname更改一下,输入命令: vi /etc/sysconfig/network 重启终端即可,将本来例如由 root@192.168.1.131 ===》 root@master 的更改;
5、安装jdk, 本例中安装jdk1.8; 切换到root 用户;