Hadoop & Hadoop Streaming 自定义输出格式

在用Hadoop处理大量的日志文件的时候,有时候会将错误的或者不符合要求的日志输出到另外一个目录,以备后来进行查验,这里给出个简单的例子,并简单说明下如何在Hadoop Streaming中使用这种方法将错误格式的日志输出到自定义的路径。

例子中类MultiFilesOutput继承自MultipleTextOutputFormat<Text, Text>,可以自己定义不同的keyType,然后输出到不同的目录下。


package MultiFormats; import org.apache.hadoop.fs.Path; import org.apache.hadoop.io.Text; import org.apache.hadoop.mapred.lib.MultipleTextOutputFormat; /** * * @author xyl * */ public class MultiFilesOutput extends MultipleTextOutputFormat<Text, Text> { /** * Use the key as part of the path for the final output results * now we just define three types * err_log: the log format we can't parse * err_oth: the other log format * pvnormal: the right log format for output pv result * uvnormal: the right log format for output uvresult */ @Override protected String generateFileNameForKeyValue(Text key, Text value, String leaf) { String keyType = new String(key.toString()); if(keyType.equals("err_log")) { return new Path("err_log",leaf).toString(); } if(keyType.equals("err_oth")) { return new Path("err_oth",leaf).toString(); } /* * return new Path("normal",leaf).toString(); */ if(keyType.equals("pvnormal")) { return new Path("pvnormal",leaf).toString(); } return new Path("uvnormal", leaf).toString(); } /** * When actually writing the data, discard the key since it is already in * the file path. */ @Override protected Text generateActualKey(Text key, Text value) { return null; } } </text></text>

在Hadoop Streaming,使用扩展的jar文件格式如下:

INPUT=/user/flume/${PATH} OUTPUT=/user/dplog/errlog/${DATE} #JOBNAME: displayed mapreduce jobname, better add job owner name JOBNAME="${DATE}-pvTest""(xyl)" ###################################################################### # Check if output directory aready exists # -------------------------------------------------------------------- #if $(/opt/hadoop/bin/hadoop fs -test -d ${OUTPUT}) #then # echo "Output Directory" $OUTPUT "already exists." # Other action code can be added at here # exit 100 #else # echo "Output Directory will be created!" #fi /opt/hadoop/bin/hadoop fs -rmr ${OUTPUT} ###################################################################### # Main hadoop streaming process # -------------------------------------------------------------------- /opt/hadoop/bin/hadoop jar ${STREAMING_JAR} \ -libjars /opt/home/hadoop/xyl/Jars/CustomOutputFormats.jar \ -Dmapred.job.name=${JOBNAME} \ -Dmapred.reduce.tasks=1 \ -input ${INPUT} \ -output ${OUTPUT} \ -mapper mapper.py \ -reducer reducer.py \ -file /opt/home/hadoop/xyl/mappers/mapper.py \ -file /opt/home/hadoop/xyl/reducers/reducer.py \ -outputformat MultiFormats.MultiFilesOutput \ ;

其中CustomOutputFormats.jar 为生成的jar文件名称,MultiFormats.MultiFilesOutput对应于package name和类名。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值