HDFS 数据读写流程

读流程

在这里插入图片描述
1) 客户端通过调用FileSystem对象的open()方法来打开希望读取的文件,对于HDFS来说,这个对象是分布式文件系统(DistributedFileSystem)的一个实例。
2) DistributedFileSystem通过使用RPC来调用namenode,以确定起始块的位置。对于每一个快,namenode返回存有该块副本的datanode地址。这些datanode根据它们与客户端的距离来排序。如果该客户端本身是一个datanode,并保存有相应数据块的一个副本时,该节点就会从本地datanode读取数据。
3) DistributedFileSystem类返回一个FSDataInputStream对象给客户端并读取数据。FSDataInputStream类转而封装DFSInputStream对象,该对象管理着datanode和namenode的I/O。接着,客户端对这个输入流调用read()方法。
4) 存储着文件起始几个块的datanode地址的DFSInputStream随即连接距离最近的datanode。通过对数据流反复调用read()方法,可以将数据从datanode传输到客户端。
5) 到达块的末端时,DFSInputStream关闭与该datanode的连接,然后寻找下一个块的最佳datanode。客户端只需要读取连续的流,并且对于客户端都是透明的。
6) 客户端从流中读取数据时,块是按照打开DFSInputStream与datanode新建连接的顺序读取的。它也会根据需要询问namenode来检索下一批数据的datanode的位置。一旦客户端完成读取,就对FSDataInputStream调用close()方法。
故障处理
在读取数据的时候,如果DFSInputStream在与datanode通信时遇到错误,会尝试从这个块的另外一个最邻近datanode读取数据。它也会记住那个故障datanode,以保证以后不会反复读取该节点上后续的块。DFSInputStream也会通过校验和确认从datanode发来的数据是否完整。如果发现有损坏的块,就在DFSInputStream试图从其他datanode读取复制前通知namenode。

写流程

在这里插入图片描述
1) 客户端通过对DistributedFileSystem对象调用create()函数来新建文件。
2) DistributedFileSystem对namenode创建一个RPC调用,在文件系统的命名空间中新建一个文件,此时文件中还没有相应的数据块。Namenode执行各种不同的检查以确保这个文件不存在以及客户端有新建该文件的权限。如果这些检查均通过,namenode就会为创建新文件记录一条记录;否则,文件创建失败并向客户端抛出一个IOException异常。DistributedFileSystem向客户端返回一个FSDataOutputStream对象,由此客户端可以开始写入数据。
3) 在客户端写入数据时,DFSOutputStream将它分成一个个的数据包,并写入内部队列,称为数据队列。DataStream处理数据队列,它的责任是根据datanode列表来要求namenode分配适合的新块来存储数据副本。这一组datanode构成一个管线。
4) DataStreamer将数据包流式传输到管线中第一个datanode,该datanode存储数据包并将它发送到管线中的第二个datanode。同样,第二个datanode存储该数据包并且发送给管线中的第三个datanode。
5) DFSOutputStream也维护着一个内部数据包队列来等待datanode的收到确认回执,称为确认队列。收到管道中所有datanode确认信息后,该数据包才会从确认队列删除。
6) 客户端完成数据的写入后,对数据流调用close()方法。该操作将剩余的所有数据包写入datanode管线,并在联系到namenode且发送文件写入完成信号之前,等待确认。Namenode已经知道文件由哪些块组成,所以它在返回成功前只需要等待数据块进行最小量的复制。
故障处理
如果数据在写入期间,datanode发生故障,首先关闭管线,确认把队列中的所有数据包都添加回数据队列的最前端,以确保故障节点下游的datanode不会漏掉任何一个数据包。为存储在另一正常datanode的当前数据块指定一个新的标识,并将该标识传送给namenode,以便故障datanode在恢复后可以删除存储的部分数据块。从管线中删除故障数据节点并且把余下的数据块写入管线中另外两个正常的datanode。Namenode注意到块副本量不足时,会在另一个节点上创建一个新的副本。后续的数据块继续正常接收处理。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值