一、Hadoop
(一)定义
Hadoop 是一个由 Apache 基金会所开发的分布式系统基础架构。用户可以在不了解分布式底层细节的情况下,开发分布式程序。充分利用集群的威力进行高速运算和存储。Hadoop 实现了一个分布式文件系统(Hadoop Distributed File System),简称 HDFS。HDFS 有高容错性的特点,并且设计用来部署在低廉的(low-cost)硬件上;而且它提供高吞吐量(high throughput)来访问应用程序的数据,适合那些有着超大数据集(large data set)的应用程序。
(二)运行模式:
-
本地模式:一个节点,不会启动任何服务
-
伪分布式模式:一个节点,所有服务均运行在该节点上
-
分布式模式:多个节点
二、Hadoop 构成:HDFS(分布式存储系统)
(一)HDFS 特性:
1. 良好的扩展性
2. 高容错性(多备份性,保持数据不丢失)
3. 适合 PB 级以上海量数据的存储
(二)基本原理:
1. 将文件切分成等大的数据块,存储到多台机器上
2. 将数据切分、容错、负载均衡等功能透明化
3. 可将 HDFS 看成一个容量巨大、具有高容错性的磁盘
(三