DataNode详解

最新推荐文章于 2024-07-03 20:49:24 发布

AngeJT

最新推荐文章于 2024-07-03 20:49:24 发布

阅读量2.4k

点赞数

分类专栏： Hadoop 文章标签： HDFS NameNode

本文链接：https://blog.csdn.net/weixin_37838429/article/details/81697766

版权

本文详细介绍了HDFS中的DataNode工作机制，包括数据存储、数据完整性检查、掉线时限参数设置，以及如何安全地服役新数据节点和退役旧节点。此外，还讨论了DataNode的多目录配置，确保集群的高效运行和数据管理。

摘要由CSDN通过智能技术生成

一、DataNode工作机制

DataNode工作机制，如图3

1）一个数据块在DataNode上以文件形式存储在磁盘上，包括两个文件，一个是数据本身，一个是元数据包括数据块的长度，块数据的校验和，以及时间戳。
2）DataNode启动后向NameNode注册，通过后，周期性（1小时）的向NameNode上报所有的块信息。
3）心跳是每3秒一次，心跳返回结果带有NameNode给该DataNode的命令如复制块数据到另一台机器，或删除某个数据块。如果超过10分钟没有收到某个DataNode的心跳，则认为该节点不可用。
4）集群运行中可以安全加入和退出一些机器。

二、数据完整性

1）当DataNode读取block的时候，它会计算checksum。
2）如果计算后的checksum，与block创建时值不一样，说明block已经损坏。
3）client读取其他DataNode上的block。
4）datanode在其文件创建后周期验证checksum，如图3-16所示。
校验和

三、掉线时限参数设置

DataNode进程死亡或者网络故障造成DataNode无法与NameNode通信，NameNode不会立即把该节点判定为死亡，要经过一段时间，这段时间暂称作超时时长。HDFS默认的超时时长为10分钟+30秒。如果定义超时时间为timeout，则超时时长的计算公式为：

    timeout  = 2 * dfs.namenode.heartbeat.recheck-interval + 10 * dfs.heartbeat.interval。

而默认的dfs.namenode.heartbeat.recheck-interval大小为5分钟，dfs.heartbeat.interval默认为3秒。
需要注意的是hdfs-site.xml配置文件中的heartbeat.recheck.interval的单位为毫秒，dfs.heartbeat.interval的单位为秒。

<property>
    <name>dfs.namenode.heartbeat.recheck-interval</name>
    <value>300000</value>
</property>
<property>
    <name> dfs.heartbeat.interval </name>
    <value>3</value>
</property>

四、服役新数据节点

举个栗子

随着公司业务的增长，数据量越

最低0.47元/天解锁文章

AngeJT

关注

0
点赞
踩
8

收藏

觉得还不错? 一键收藏
0
评论
DataNode详解

一、DataNode工作机制DataNode工作机制，如图3 1）一个数据块在DataNode上以文件形式存储在磁盘上，包括两个文件，一个是数据本身，一个是元数据包括数据块的长度，块数据的校验和，以及时间戳。 2）DataNode启动后向NameNode注册，通过后，周期性（1小时）的向NameNode上报所有的块信息。 3）心跳是每3秒一次，心跳返回结果带有NameNode给该Da...
复制链接

扫一扫

专栏目录