MapReduce统计文件单词

本文详细介绍了如何在Ubuntu虚拟机上进行Hadoop伪分布式安装,包括创建Hadoop用户,安装Java环境,配置Hadoop,执行MapReduce的WordCount任务。通过这些步骤,读者可以学习到大数据环境的搭建与基本操作。
摘要由CSDN通过智能技术生成

以下将详细讲解目录中每一步的配置命令以及截图,方便大家进行操作


一、 首先利用Windows中使用VirtualBox安装Ubuntu

本实验采用Ubuntu Kylin版本。Ubuntu Kylin系统文件可以从参考资料[1]中获取。 本篇文章是结合厦门大学林子雨的大数据技术原理与应用(第2版)进行操作,运行环境是在VirtualBox安装Ubuntu Kylin系统这个大环境下进行操作的。建议初学者在做实验时可以参考一下林子雨相关文档进行食用,效果更佳(文章末尾有参考资料)。此博客记录的是创建hadoop用户,增加管理员权限,hadoop的单机安装,最终实现调用MapReduce执行WordCount对单词进行计数

二、 前期准备工作

1. 创建帐户Hadoop

sudo useradd -m hadoop -s /bin/bash

2. 设置hadoop密码

 sudo passwd hadoop

3. 给hadoop用户增加管理员权限

 sudo adduser hadoop sudo

在完成注销当前用户,返回登陆界面。在登陆界面中选择hadoop 用户进行登录。

4. 更新 apt

登录成功后,先更新一下apt,后面将会使用apt安装软件,如果没有更新可能无法完成后续安装(如所示下图)。在终端执行以下命令:

sudo apt-get update

在这里插入图片描述

5. 安装vim

在后续的配置文件时,将会使用vim进行编辑,所以可以安装vim,命令如下:

 sudo apt-get install vim

在这里插入图片描述

6. 配置SSH

(1)集群、单节点模式都需要用到 SSH 登陆,在ubuntu 默认已安装了 SSH client,此外还需要安装 SSH server:

sudo apt-get install openssh-server

(2)安装后,可以使用如下命令登陆本机:

ssh localhost

在此时会有提示(SSH首次登陆提示),输入 yes 。然后按提示输入密码 hadoop,这样就登陆到本机了。 但这样登陆是需要每次输入密码的,因此需要配置成SSH无密码登陆较为方便。
在这里插入图片描述

(3)首先退出刚才的 ssh,就回到了我们原先的终端窗口,然后利用 ssh-keygen 生成密钥,并将密钥加入到授权中:

exit                                   # 退出刚才的 ssh localhost
cd ~/.ssh/                             # 若没有该目录,请先执行一次ssh localhost
ssh-keygen -t rsa                      # 会有提示,都按回车就可以
cat ./id_rsa.pub >> ./authorized_keys  # 加入授权

此时再使用 ssh localhost 命令,无需输入密码就可以直接登陆了,如下图所示。
在这里插入图片描述

三、 安装Java环境

1.安装JDK

我们已经把JDK1.8的安装包jdk-8u162-linux-x64.tar.gz放在了 百度云盘,可以点击这里到百度云盘下载JDK1.8安装包(提取码:99bg).
请把压缩格式的文件jdk-8u162-linux-x64.tar.gz下载到本地电脑,假设保存在“/home/linziyu/Downloads/”目录下。

接下来在Linux命令行界面中,执行如下的命令(注意:当前登录用户名是hadoop):

cd /usr/lib
sudo mkdir jvm                             #创建/usr/lib/jvm目录用存放jdk文件
cd ~                                       #进入hadoop用户的主目录下
cd Downloads  
sudo tar -zxvf ./jdk-8u162-linux-x64.tar.gz -C /usr/lib/jvm    #把JDK文件解压到/usr/lib/jvm目录下

上面使用了解压缩命令tar,如果对Linux命令不熟悉,可以参考常用的Linux命令用法。 点击此处参考常用Linux命令

2.验证一下jdk安装情况

cd /usr/lib/jvm
ls

可以看到,在/usr/lib/jvm目录下有个jdk1.8.0_162目录。
在这里插入图片描述

3.继续执行如下命令,需要设置java环境变量

cd ~
vim ~/.bashrc

通过使用vim编辑器。(查看vim编辑器使用方法)打开.bashrc文件,配置java环境变量。

export JAVA_HOME=/usr/lib/jvm/jdk1.8.0_162
export JRE_HOME=${
   JAVA_HOME}/jre
export CLASSPATH=.:${
   JAVA_HOME}/lib:${
   JRE_HOME}/lib
export PATH=${
   JAVA_HOME}/bin:$PATH

保存.bashrc文件并退出vim编辑器。然后,继续执行如下命令让.bashrc文件的配置立即生效:

source ~/.bashrc

按esc键退出,再按:wq!保存文件配置信息。

4.验证java的安装情况

java -version

若返回如下信息,则说明JAVA环境配置成功
在这里插入图片描述

四、 安装Hadoop

1.首先下载hadoop,这里选择使用Hadoop2.10.0版本。

Hadoop官网下载hadoop-3.1.3.tar.gz

2.将 Hadoop 安装至 /usr/local/ 中:

sudo tar -zxf ~/下载/hadoop-3.1.3.tar.gz -C /usr/local    # 解压到/usr/local中
cd /usr/local/
sudo mv ./hadoop-3.1.3/ ./hadoop                         # 将文件夹名改为hadoop
sudo chown -R hadoop ./hadoop                            # 修改文件权限

3.验证Hadoop是否可用,成功则会显示 Hadoop 版本信息,如下图所示。

cd /usr/local/hadoop
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值