在之前的文章曾提到Hadoop不仅支持用Java编写的job,也支持其它语言编写的作业,比如Hadoop Streaming(shell、python)和Hadoop Pipes(c++),本篇文章将学习Hadoop Streaming编程。Streaming是hadoop自带的工具,封装在hadoop-streaming-版本号.jar中,可以使用hadoop jar hadoop-streaming-版本号.jar命令启动,在该命令中还需要指定mapper或/和reducer,其中mapper和reducer任务既可以是java类,也可以是可执行文件(如cat)或脚本文件(如python)。该工具将创建MapReduce作业,将作业提交给集群处理并监控作业的执行进度等,下面分析一下Streaming的执行过程。
当可执行文件做为mapper或者reducer时,每个mapper任务或者reducer任务在mapper或者reducer初始化后将可执行文件做为独立的进程加载运行。当mapper任务运行时,它将输入转换为行然后把这些行传递给该进程的标准输入stdin,同时mapper收集从该进程的标准输出stdout产生的行并将每行转换为键值对,这些键值对将做为该mapper的输出。默认的情况下,一行的开始部分到第一个tab符为键,剩余的部分(不包括tab符ÿ