hadoop编程小技巧（6）---处理大量小数据文件CombineFileInputFormat应用

最新推荐文章于 2024-06-25 23:03:12 发布

fansy1990

最新推荐文章于 2024-06-25 23:03:12 发布

阅读量3.5k

点赞数

分类专栏： hadoop 编程

本文链接：https://blog.csdn.net/fansy1990/article/details/38060233

版权

本文介绍了如何使用CombineFileInputFormat在Hadoop中高效处理大量小数据文件。通过结合小文件，减少Mapper数量，提高处理效率。通过实例展示了 CombineFileInputFormat 的应用，适用于特定的大数据场景。

摘要由CSDN通过智能技术生成

代码测试环境：Hadoop2.4

应用场景：当需要处理很多小数据文件的时候，可以应用此技巧来达到高效处理数据的目的。

原理：应用CombineFileInputFormat，可以把多个小数据文件在进行分片的时候合并。由于每个分片会产生一个Mapper，当一个Mapper处理的数据比较小的时候，其效率较低。而一般使用Hadoop处理数据时，即默认方式，会把一个输入数据文件当做一个分片，这样当输入文件较小时就会出现效率低下的情况。

实例：

参考前篇blog：hadoop编程小技巧（5）---自定义输入文件格式类InputFormat，不过这次输入使用两个输入文件，都是小数据量的数据文件。

自定义输入文件格式：CustomCombineFileInputFormat：

package fz.combineinputformat;

import java.io.IOException;

import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.InputSplit;
import org.apache.hadoop.mapreduce.RecordReader;
import org.apache.hadoop.mapreduce.TaskAttemptContext;
import org.apache.hadoop.mapreduce.lib.input.CombineFileInputFormat;
import org.apache.had