HDFS分布式文件系统详细介绍

最新推荐文章于 2024-05-17 19:36:24 发布

Bitmao888

最新推荐文章于 2024-05-17 19:36:24 发布

阅读量2k

点赞数

分类专栏：大数据文章标签：大数据 hadoop

本文链接：https://blog.csdn.net/weixin_45788152/article/details/105212207

版权

文章目录

1、分布式文件系统详细介绍

在hadoop当中，分布式文件系统（HDFS），对文件系统有一个抽象，HDFS属于当中的一个实现类，也就是说分布式文件系统类似于一个接口，定义了标准，下面有很多的实现类，其中HDFS是一个子实现类而已，但是现在很多人都只知道一种就是HDFS的实现，并没有了解过其他的实现类，其实分布式文件系统的实现有很多种.

2、HDFS分布式文件系统设计目标

1、硬件错误由于集群很多时候由数量众多的廉价机组成，使得硬件错误成为常态
2、数据流访问所有应用以流的方式访问数据，设置之初便是为了用于批量的处理数据，而不是低延时的实时交互处理
3、大数据集典型的HDFS集群上面的一个文件是以G或者T数量级的，支持一个集群当中的文件数量达到千万数量级
4、简单的相关模型假定文件是一次写入，多次读取的操作
5、移动计算比移动数据便宜一个应用请求的计算，离它操作的数据越近，就越高效
6、多种软硬件的可移植性

3、HDFS的来源

HDFS起源于Google的GFS论文（GFS，Mapreduce，BigTable为google的旧的三驾马车），发表于2003年10月
HDFS是GFS的克隆版
Hadoop Distributed File system
易于扩展的分布式文件系统
运行在大量普通廉价机器上，提供容错机制，为大量用户提供性能不错的文件存取服务

4、HDFS的架构图之基础架构

在这里插入图片描述
1、 NameNode是一个中心服务器，单一节点（简化系统的设计和实现），负责管理文件系统的名字空间（namespace）以及客户端对文件的访问
2、文件操作，namenode是负责文件元数据的操作，datanode负责处理文件内容的读写，跟文件内容相关的数据流不经过Namenode，只询问它跟哪个dataNode联系，否则NameNode会成为系统的瓶颈
3、副本存放在哪些Datanode上由NameNode来控制，根据全局情况作出块放置决定，读取文件时NameNode尽量让用户先读取最近的副本，降低读取网络开销和读取延时
4、 NameNode全权管理数据的复制，它周期性的从集群中的每个DataNode接收心跳信息和状态报告，接收到心跳信号意味着DataNode节点工作正常，块状态报告包含了一个该DataNode上所有的数据列表
NameNode与Datanode的总结概述
在这里插入图片描述
hdfs的架构之文件的文件副本机制以及block块存储

所有的文件都是以block块的方式存放在HDFS文件系统当中，在hadoop1当中，文件的block块默认大小是64M，hadoop2当中，文件的block块大小默认是128M，block块的大小可以通过hdfs-site.xml当中的配置文件进行指定

 <property>
        <name>dfs.block.size</name>
        <value>块大小 以字节为单位</value>//只写数值就可以
    </property>

5、抽象成数据块的好处

一个文件有可能大于集群中任意一个磁盘
10T*3/128

最低0.47元/天解锁文章

Bitmao888

关注

0
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
HDFS分布式文件系统详细介绍

文章目录1、分布式文件系统详细介绍2、HDFS分布式文件系统设计目标3、HDFS的来源4、HDFS的架构图之基础架构5、抽象成数据块的好处块缓存hdfs的文件权限验证6、HDFS的元数据信息FSimage以及edits和secondaryNN的作用FSImage与edits详解FSimage文件当中的文件信息查看edits当中的文件信息查看secondarynameNode如何辅助管理FSImag...
复制链接

扫一扫

专栏目录