MapReduce统计文件单词
以下将详细讲解目录中每一步的配置命令以及截图,方便大家进行操作
一、 首先利用Windows中使用VirtualBox安装Ubuntu
本实验采用Ubuntu Kylin版本。Ubuntu Kylin系统文件可以从参考资料[1]中获取。 本篇文章是结合厦门大学林子雨的大数据技术原理与应用(第2版)进行操作,运行环境是在VirtualBox安装Ubuntu Kylin系统这个大环境下进行操作的。建议初学者在做实验时可以参考一下林子雨相关文档进行食用,效果更佳(文章末尾有参考资料)。此博客记录的是创建hadoop用户,增加管理员权限,hadoop的单机安装,最终实现调用MapReduce执行WordCount对单词进行计数
二、 前期准备工作
1. 创建帐户Hadoop
sudo useradd -m hadoop -s /bin/bash
2. 设置hadoop密码
sudo passwd hadoop
3. 给hadoop用户增加管理员权限
sudo adduser hadoop sudo
在完成注销当前用户,返回登陆界面。在登陆界面中选择hadoop 用户进行登录。
4. 更新 apt
登录成功后,先更新一下apt,后面将会使用apt安装软件,如果没有更新可能无法完成后续安装(如所示下图)。在终端执行以下命令:
sudo apt-get update
5. 安装vim
在后续的配置文件时,将会使用vim进行编辑,所以可以安装vim,命令如下:
sudo apt-get install vim
6. 配置SSH
(1)集群、单节点模式都需要用到 SSH 登陆,在ubuntu 默认已安装了 SSH client,此外还需要安装 SSH server:
sudo apt-get install openssh-server
(2)安装后,可以使用如下命令登陆本机:
ssh localhost
在此时会有提示(SSH首次登陆提示),输入 yes 。然后按提示输入密码 hadoop,这样就登陆到本机了。 但这样登陆是需要每次输入密码的,因此需要配置成SSH无密码登陆较为方便。
(3)首先退出刚才的 ssh,就回到了我们原先的终端窗口,然后利用 ssh-keygen 生成密钥,并将密钥加入到授权中:
exit # 退出刚才的 ssh localhost
cd ~/.ssh/ # 若没有该目录,请先执行一次ssh localhost
ssh-keygen -t rsa # 会有提示,都按回车就可以
cat ./id_rsa.pub >> ./authorized_keys # 加入授权
此时再使用 ssh localhost 命令,无需输入密码就可以直接登陆了,如下图所示。
三、 安装Java环境
1.安装JDK
我们已经把JDK1.8的安装包jdk-8u162-linux-x64.tar.gz放在了 百度云盘,可以点击这里到百度云盘下载JDK1.8安装包(提取码:99bg).
请把压缩格式的文件jdk-8u162-linux-x64.tar.gz下载到本地电脑,假设保存在“/home/linziyu/Downloads/”目录下。
接下来在Linux命令行界面中,执行如下的命令(注意:当前登录用户名是hadoop):
cd /usr/lib
sudo mkdir jvm #创建/usr/lib/jvm目录用存放jdk文件
cd ~ #进入hadoop用户的主目录下
cd Downloads
sudo tar -zxvf ./jdk-8u162-linux-x64.tar.gz -C /usr/lib/jvm #把JDK文件解压到/usr/lib/jvm目录下
上面使用了解压缩命令tar,如果对Linux命令不熟悉,可以参考常用的Linux命令用法。 点击此处参考常用Linux命令
2.验证一下jdk安装情况
cd /usr/lib/jvm
ls
可以看到,在/usr/lib/jvm目录下有个jdk1.8.0_162目录。
3.继续执行如下命令,需要设置java环境变量
cd ~
vim ~/.bashrc
通过使用vim编辑器。(查看vim编辑器使用方法)打开.bashrc文件,配置java环境变量。
export JAVA_HOME=/usr/lib/jvm/jdk1.8.0_162
export JRE_HOME=${
JAVA_HOME}/jre
export CLASSPATH=.:${
JAVA_HOME}/lib:${
JRE_HOME}/lib
export PATH=${
JAVA_HOME}/bin:$PATH
保存.bashrc文件并退出vim编辑器。然后,继续执行如下命令让.bashrc文件的配置立即生效:
source ~/.bashrc
按esc键退出,再按:wq!保存文件配置信息。
4.验证java的安装情况
java -version
若返回如下信息,则说明JAVA环境配置成功
四、 安装Hadoop
1.首先下载hadoop,这里选择使用Hadoop2.10.0版本。
Hadoop官网下载hadoop-3.1.3.tar.gz
2.将 Hadoop 安装至 /usr/local/ 中:
sudo tar -zxf ~/下载/hadoop-3.1.3.tar.gz -C /usr/local # 解压到/usr/local中
cd /usr/local/
sudo mv ./hadoop-3.1.3/ ./hadoop # 将文件夹名改为hadoop
sudo chown -R hadoop ./hadoop # 修改文件权限
3.验证Hadoop是否可用,成功则会显示 Hadoop 版本信息,如下图所示。
cd /usr/local/hadoop