剖析HDFS文件的读取

最新推荐文章于 2023-07-24 09:54:08 发布

SweeneyZuo

最新推荐文章于 2023-07-24 09:54:08 发布

阅读量454

点赞数

分类专栏： hadoop

本文链接：https://blog.csdn.net/Sweeneyzuo/article/details/84559802

版权

hadoop 专栏收录该内容

10 篇文章 0 订阅

订阅专栏

客户端通过调用FileSystem对象的open()方法来打开希望读取的文件，对于HDFS来说，这个对象是DistributedFileSystem的一个实例(图中的步骤1)。DistributedFileSystem通过使用远程过程调用(RPC)来调用namenode,以确定文件起始块的位置(步骤2)。对于每一个块，namenode返回存有该块副本的datanode地址。此外，这些datanode根据它们与客户端的距离来排序(根据集群的网络拓扑)。如果该客户端本身就是一个datanode(比如，在一个MapReduce任务中)，那么该客户端将会从保存有相应数据块复本的本地datanode读取数据。

DistributedFileSystem类返回一个FSDataInputStream对象(一个支持文件定位的输入流)给客户端以便读取数据。FSDataInputStream类中封装着DFSInputStream对象，该对象管理着datanode和namenode的I/O。

接着，客户端对这个输入流调用read()方法(步骤3)。存储着文件起始几个块的datanode地址的DFSInputStream随即连接距离最近的文件中第一个块所在的datanode。通过对数据流反复调用read()方法，可以将数据从datanode 传输到客户端(步骤4)。到达块的末端时，DFSInputStream关闭与该datanode的连接，然后寻找下一个块的最佳datanode(步骤5)。所有这些对于客户端都是透明的，在客户看来它一直在读取一个连续的流。

客户端从流中读取数据时，块是按照打开DFSInputStream与datanode 新建连接的顺序读取的。它也会根据需要询问namenode来检索下一批数据块的datanode的位置。一旦客户端完成读取，就对FSDataInputStream调用close()方法(步骤6)。在读取数据的时候，如果DFSInputStream在与datanode 通信时遇到错误，会尝试从这个块的另外一个最邻近datanode读取数据。它也记住那个故障datanode,以保证以后不会反复读取该节点上后续的块。DFSInputStream也会通过校验和确认从datanode发来的数据是否完整。如果发现有损坏的块，DFSInputStream会试图从其他datanode读取其复本，也会将被损坏的块通知给namenode。

这个设计的一个重点是，客户端可以直接连接到datanode检索数据，且namenode告知客户端每个块所在的最佳datanode。由于数据流分散在集群中的所有datanode,所以这种设计能使HDFS扩展到大量的并发客户端。同时，namenode只需要响应块位置的请求(这些信息存储在内存中，因而非常高效)，无需响应数据请求，否则随着客户端数量的增长，namenode会很快成为瓶颈。

SweeneyZuo

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
剖析HDFS文件的读取

客户端通过调用FileSystem对象的open()方法来打开希望读取的文件，对于HDFS来说，这个对象是DistributedFileSystem的一个实例(图中的步骤1)。DistributedFileSystem通过使用远程过程调用(RPC)来调用namenode,以确定文件起始块的位置(步骤2)。对于每一个块，namenode返回存有该块副本的datanode地址。此外，这些d...
复制链接

扫一扫

专栏目录