HDFS基本原理
NameNode 概述
- NameNode 是 HDFS 的核心。
- NameNode 也称为 Master。
- NameNode 仅存储 HDFS 的元数据:文件系统中所有文件的目录树,并跟踪整个集群中的文件。
- NameNode 不存储实际数据或数据集。数据本身实际存储在 DataNodes 中。
- NameNode 知道 HDFS 中任何给定文件的块列表及其位置。使用此信息NameNode 知道如何从块中构建文件。
- NameNode 并不持久化存储每个文件中各个块所在的 DataNode 的位置信息,这些信息会在系统启动时从数据节点重建。
- NameNode 对于 HDFS 至关重要,当 NameNode 关闭时,HDFS / Hadoop 集群无法访问。
- NameNode 是 Hadoop 集群中的单点故障。
- NameNode 所在机器通常会配置有大量内存(RAM)。
DataNode 概述
- DataNode 负责将实际数据存储在 HDFS 中。
- DataNode 也称为 Slave。
- NameNode 和 DataNode 会保持不断通信。
- DataNode 启动时,它将自己发布到 NameNode 并汇报自己负责持有的块列表。
- 当某个 Dat