Hadoop16：【面试题】InputFormat以及OutputFormat分析

最新推荐文章于 2023-08-26 21:50:33 发布

做一个有趣的人Zz

最新推荐文章于 2023-08-26 21:50:33 发布

阅读量808

点赞数 1

分类专栏： hadoop 文章标签： hdfs hadoop mr

本文链接：https://blog.csdn.net/weixin_40612128/article/details/123232395

版权

hadoop 专栏收录该内容

57 篇文章 2 订阅 ¥59.90 ¥99.00

订阅专栏

一、InputFormat

Hadoop中有一个抽象类是InputFormat，InputFormat抽象类是MapReduce输入数据的顶层基类，这个抽象类中只定义了两个方法

一个是getSplits方法
另一个是createRecordReader方法

这个抽象类下面有三个子继承类

DBInputFormat是操作数据库的，
FileInputFormat是操作文件类型数据的，
DelegatingInputFormat是用在处理多个输入时使用的

这里面比较常见的也就是FileInputFormat了，FileInputFormat是所有以文件作为数据源的基类，FileInputFormat保存job输入的所有文件，并实现了对输入文件计算splits的方法，至于获得文件中数据的方法是由子类实现的。
FileInputFormat下面还有一些子类：

CombineFileInputFormat：处理小文件问题的，后面我们再详细分析
TextInputFormat：是默认的处理类，处理普通文本文件，他会把文件中每一行作为一个记录，将每一行的起始偏移量作为key，每一行的内容作为value，这里的key和value就是我们之前所说的k1,v1
它默认以换行符或回车键作为一行记录
NLineInputFormat：可以动态指定一次读取多少行数据
这里面的TextInputFormat是我们处理文本数据的默认处理类，TextInputFormat的顶层基类是InputFormat，下面我们先来看一下这个抽象类的源码

1、下载源码

下载hadoop的源码&#

了解本专栏

做一个有趣的人Zz

关注

1
点赞
踩
5

收藏

觉得还不错? 一键收藏
打赏
2
评论
Hadoop16：【面试题】InputFormat以及OutputFormat分析

一、InputFormatHadoop中有一个抽象类是InputFormat，InputFormat抽象类是MapReduce输入数据的顶层基类，这个抽象类中只定义了两个方法一个是getSplits方法另一个是createRecordReader方法这个抽象类下面有三个子继承类DBInputFormat是操作数据库的，FileInputFormat是操作文件类型数据的，DelegatingInputFormat是用在处理多个输入时使用的这里面比较常见的也就是FileInputFormat
复制链接

扫一扫