大数据Hadoop之HDFS读取过程总结

最新推荐文章于 2021-12-28 11:34:28 发布

光圈1001

最新推荐文章于 2021-12-28 11:34:28 发布

阅读量1.2k

点赞数

分类专栏： hadoop 文章标签：大数据 Hadoop HDFS 读取原理u

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_41919284/article/details/81253987

版权

hadoop 专栏收录该内容

16 篇文章 0 订阅

订阅专栏

这里写图片描述

读取流程原理：
1.HDFS Client与NN通信，获取文件信息：
文件有多少块，分别在哪些DN上
2.业务调用read API 进行读写文件操作
3.HDFS Clien根据NN返回的元数据信息，与DN通信
此处Client采用就近原则读取数据，数据有多块时，不同DN，Client会同时与多个DN通信，获取数据块
4.数据读取完成以后，业务调用close关闭连接，读取结束

当Client与NN通信时，NN有验证机制，
验证1：Client发送的请求信息，是否存在
验证2：Client发送的请求，权限是否满足

NN验证机制通过以后，给Client返回的信息内容包含：
1.此文件分成了多少个块
2.这些快分别在哪些DN上，即DN的位置信息

Client读取数据的就近原则：
就近原则：近：响应请求的时间短
即：在两个或者多个副本时，Client会选择响应时间最短的那个副本进行读取操作，也就是选择最优的副本进行读写

HDFS架构其他关键设计要点说明：
1.统一的文件系统名字空间:
HDFS对外仅呈现一个统一的文件系统。
2.统一的通讯协议
统一采用RPC方式通信。 NameNode被动的接收Client, DataNode的RPC请求。
特殊：SN与NN的通讯协议为http
3.空间回收机制
支持回收站机制，以及副本数的动态设置机制。
副本数动态机制，只能增加，不能减少
4.数据组织
数据存储以数据块为单位，存储在操作系统的文件系统上。
分块时。最后一块的空间大小是文件的实际大小，并非128M
5.访问方式
提供JAVA API，HTTP方式，SHELL方式访问HDFS数据

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。