HDFS 的数据写入与读取

上号了大叔

于 2023-09-01 15:54:19 发布

阅读量197

点赞数 1

文章标签： hdfs hadoop 大数据

本文链接：https://blog.csdn.net/weixin_53532169/article/details/132624911

版权

写入过程

在这里插入图片描述

1.写入DataNode之前必须访问NameNode,NameNode允许写入后方可写入数据
2.数据文件已packet包的形式进行拆分,每64kb一个包,进行数据传输
3.向DataNode写入数据时,不是同时写入三个服务器,而是间将第一个副本写入后,由该副本所在的DataNode备份到其他服务中
4.每个packet写入完成后会进行ack回调,收到回调后会写入下一个packet,如果一个block写满后会开启下一个block块继续写入,直到数据写入完成
5.所有数据写入完成后,需要向NameNode汇报写入完成,NameNode查询确认后保存元数据信息,方可使用该文件.
NameNode查询确认时,只要有一个副本完整保存,则元数据信息即可开放使用

注意

写入三个Datanode是写入一个再进行备份。
因为现实中带宽并不是无限的，三个同时写入会降低效率。
同时向三个服务写入：

带宽30M/s 一次写入三个服务器共用30M带宽, 每一个DataNode占用10M/s 传完一个10M的数据需要1S

使用pipiline写入：

带宽30M/s 先写入第一个DataNode占用完整带宽30M/s 传输一个10M的数据需要0.33秒
第一个DataNode将数据备份到第二个DataNode,也是30M/s带块,传输一个10M的数据需要0.33秒
第二个DataNode传输到第三个DataNode,也是0.33秒
由于我们将数据拆分为多个packet包,所以可以异步备份,此时完成数据存储的总用时一定小于1s

所以在带宽有限的情况下，选择pipline传输，而且互联网传输分为上行和下行，两者互不影响，使用pipline充分利用了带宽

读取过程

在这里插入图片描述

1.NameNode返回的blcok位置列表中,不仅包含块位置还包含其副本的位置
2.1. 如果出现DataNode不可用的情况会在读取结束后向NameNode进行汇报,如果无不可用的情况不需要向NameNode进行任何汇报
3.读取文件时先读取到内存缓冲区,当将多个block读取完成后进行拼接合并后写入文件中.

上号了大叔

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
1
评论
HDFS 的数据写入与读取

4.每个packet写入完成后会进行ack回调,收到回调后会写入下一个packet,如果一个block写满后会开启下一个block块继续写入,直到数据写入完成。3.向DataNode写入数据时,不是同时写入三个服务器,而是间将第一个副本写入后,由该副本所在的DataNode备份到其他服务中。5.所有数据写入完成后,需要向NameNode汇报写入完成,NameNode查询确认后保存元数据信息,方可使用该文件.1.写入DataNode之前必须访问NameNode,NameNode允许写入后方可写入数据。
复制链接

扫一扫