Hadoop 实战之Streaming（二）-CSDN博客

本文链接：https://blog.csdn.net/xiaocaichonga/article/details/8096925

环境：Vmware 8.0 和ubuntu11.04

Hadoop 实战之Streaming（三）---通过Unix命令使用Streaming

第一步: 首先在/home/tanglg1987目录下新建一个start.sh脚本文件，每次启动虚拟机都要删除/tmp目录下的全部文件，重新格式化namenode，代码如下：

sudo rm -rf /tmp/*
rm -rf /home/tanglg1987/hadoop-0.20.2/logs
hadoop namenode -format
hadoop datanode -format
start-all.sh
hadoop fs -mkdir input 
hadoop dfsadmin -safemode leave

第二步：给start.sh增加执行权限并启动hadoop伪分布式集群，代码如下:

chmod 777 /home/tanglg1987/start.sh
./start.sh

执行过程如下：

第三步：编写一个名为：list-4-2.sh的shell脚本

$HADOOP_HOME/bin/hadoop  jar $HADOOP_HOME/hadoop-0.20.2-streaming.jar -input output -output output_a -mapper 'wc -l'  D mapred.reduce.tasks=0

第四步：给list-4-2.sh增加执行权限并启动脚本，代码如下：

chmod 777 /home/tanglg1987/list-4-2.sh
./list-4-2.sh

第五步：Run On Hadoop，运行过程如下：

第六步：查看结果集，运行结果如下：