环境:Vmware 8.0 和ubuntu11.04
Hadoop 实战之Streaming(三)---通过Unix命令使用Streaming
第一步: 首先在/home/tanglg1987目录下新建一个start.sh脚本文件,每次启动虚拟机都要删除/tmp目录下的全部文件,重新格式化namenode,代码如下:
sudo rm -rf /tmp/*
rm -rf /home/tanglg1987/hadoop-0.20.2/logs
hadoop namenode -format
hadoop datanode -format
start-all.sh
hadoop fs -mkdir input
hadoop dfsadmin -safemode leave
第二步:给start.sh增加执行权限并启动hadoop伪分布式集群,代码如下:
chmod 777 /home/tanglg1987/start.sh
./start.sh
执行过程如下:
第三步:编写一个名为:list-4-2.sh的shell脚本
$HADOOP_HOME/bin/hadoop jar $HADOOP_HOME/hadoop-0.20.2-streaming.jar -input output -output output_a -mapper 'wc -l' D mapred.reduce.tasks=0
第四步:给list-4-2.sh增加执行权限并启动脚本,代码如下:
chmod 777 /home/tanglg1987/list-4-2.sh
./list-4-2.sh
第五步:Run On Hadoop,运行过程如下:
第六步:查看结果集,运行结果如下: