2024年大数据最新大数据之Hadoop图解概述，2024年最新腾讯T2大佬手把手教你

2401_84592111

于 2024-05-14 01:02:54 发布

阅读量389

点赞数 4

分类专栏：程序员文章标签：大数据面试学习

本文链接：https://blog.csdn.net/2401_84592111/article/details/138826448

版权

程序员专栏收录该内容

58 篇文章 0 订阅

订阅专栏

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化资料的朋友，可以戳这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

官网地址：http://hadoop.apache.org

下载地址：https://hadoop.apache.org/releases.html

②Cloudera Hadoop

官网地址：https://www.cloudera.com/downloads/cdh

下载地址：https://docs.cloudera.com/documentation/enterprise/6/releasenotes/topics/rg_cdh_6_download.html

1）2008 年成立的 Cloudera 是最早将 Hadoop 商用的公司，为合作伙伴提供 Hadoop 的

商用解决方案，主要是包括支持、咨询服务、培训。

2）2009 年 Hadoop 的创始人 Doug Cutting 也加盟 Cloudera 公司。Cloudera 产品主

要为 CDH，Cloudera Manager，Cloudera Support

3）CDH 是 Cloudera 的 Hadoop 发行版，完全开源，比 Apache Hadoop 在兼容性，安

全性，稳定性上有所增强。Cloudera 的标价为每年每个节点 10000 美元。

4）Cloudera Manager 是集群的软件分发及管理监控平台，可以在几个小时内部署好一

个 Hadoop 集群，并对集群的节点及服务进行实时监控。

③Hortonworks Hadoop

官网地址：https://hortonworks.com/products/data-center/hdp/

下载地址：https://hortonworks.com/downloads/#data-platform

1）2011 年成立的 Hortonworks 是雅虎与硅谷风投公司 Benchmark Capital 合资组建。

2）公司成立之初就吸纳了大约 25 名至 30 名专门研究 Hadoop 的雅虎工程师，上述

工程师均在 2005 年开始协助雅虎开发 Hadoop，贡献了 Hadoop80%的代码。

3）Hortonworks 的主打产品是 Hortonworks Data Platform（HDP），也同样是 100%开

源的产品，HDP 除常见的项目外还包括了 Ambari，一款开源的安装和管理系统。

4）2018 年 Hortonworks 目前已经被 Cloudera 公司收购

4 Hadoop 优势（4 高）

==================================================================================

1）高可靠性：Hadoop底层维护多个数据副本，所以即使Hadoop某个计算元素或存储出现故障，也不会导致数据的丢失。

在这里插入图片描述

2）高扩展性：在集群间分配任务数据，可方便的扩展数以千计的节点。

在这里插入图片描述

3）高效性：在MapReduce的思想下，Hadoop是并行工作的，以加快任务处理速度。

在这里插入图片描述

4）高容错性：能够自动将失败的任务重新分配。

在这里插入图片描述

5 Hadoop 组成（面试重点）

===================================================================================

在这里插入图片描述

在 Hadoop1.x 时代，Hadoop中的MapReduce同时处理业务逻辑运算和资源的调度，耦合性较大。
在Hadoop2.x 时代，增加了Yarn。Yarn只负责资源的调度，MapReduce 只负责运算。
在Hadoop3.x 时代，在组成上没有变化。

5.1 HDFS 架构概述

Hadoop Distributed File System，简称 HDFS，是一个分布式文件系统。

HDFS架构概述：

1）NameNode（nn）：存储文件的元数据，如文件名，文件目录结构，文件属性（生成时间、副本数、文件权限），以及每个文件的块列表和块所在的DataNode等。

在这里插入图片描述

2）DataNode(dn)：在本地文件系统存储文件块数据，以及块数据的校验和。

在这里插入图片描述

3）Secondary NameNode(2nn)：每隔一段时间对NameNode元数据备份。

5.2 YARN 架构概述

Yet Another Resource Negotiator 简称 YARN ，另一种资源协调者，是 Hadoop 的资源管理器。

1）ResourceManager（RM）：整个集群资源（内存、CPU等）的老大

3）ApplicationMaster（AM）：单个任务运行的老大

2）NodeManager（N M）：单个节点服务器资源老大

4）Container：容器，相当一台独立的服务器，里面封装了任务运行所需要的资源，如内存、CPU、磁盘、网络等。

在这里插入图片描述

5.3 MapReduce 架构概述

MapReduce：分布式的离线并行计算框架，对海量数据的处理。将计算过程分为Map和Reduce两个阶段，Map阶段并行处理输入数据，Reduce阶段对Map结果进行汇总。

Mapper:

1.第一阶段是把输入文件进行分片（inputSplit）得到block。有多少个block就对应启动多少maptask
2.第二阶段是对输入片中的记录按照一定的规则解析成键值对。键（key）表示每行首字符偏移值，值（value）表示本行文本内容。
3.第三阶段是调用map方法。解析出来的每个键值对，调用一次map方法。
4.第四阶段是按照一定规则对第三阶段输出的键值对进行分区。
5.第五阶段是对每个分区中的键值对进行排序。首先按照键进行排序，然后按照值。完成后将数据写入内存中，内存中这片区域叫做环形缓冲区。

Reduce:

1.第一阶段（copy）reduce任务从Mapper任务复制输出的键值对。
2.第二阶段（sort）合并排序是把复制到Reduce本地数据，全部合并。再对合并后的数据排序
3.第三阶段是对排序后的键值对调用reduce方法。键相等的键值对调用一次reduce方法，每次调用会产生零个或者多个键值对，最后把这些输出的键值对写入到HDFS文件中。

在这里插入图片描述

5.4 HDFS、YARN、MapReduce 三者关系

在这里插入图片描述

6 大数据技术生态体系

=============================================================================

在这里插入图片描述

图中涉及的技术名词解释如下：

1）Sqoop：Sqoop 是一款开源的工具，主要用于在 Hadoop、Hive 与传统的数据库（MySQL）间进行数据的传递，可以将一个关系型数据库（例如：MySQL，Oracle 等）中的数据导进到 Hadoop 的 HDFS 中，也可以将 HDFS 的数据导进到关系型数据库中。

2）Flume：Flume 是一个高可用的，高可靠的，分布式的海量日志采集、聚合和传输的系统，Flume 支持在日志系统中定制各类数据发送方，用于收集数据；

3）Kafka：Kafka 是一种高吞吐量的分布式发布订阅消息系统；

4）Spark：Spark 是当前最流行的开源大数据内存计算框架。可以基于 Hadoop 上存储的大数据进行计算。

5）Flink：Flink 是当前最流行的开源大数据内存计算框架。用于实时计算的场景较多。

6）Oozie：Oozie 是一个管理 Hadoop 作业（job）的工作流程调度管理系统。

7）Hbase：HBase 是一个分布式的、面向列的开源数据库。HBase 不同于一般的关系数据库，

它是一个适合于非结构化数据存储的数据库。

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化资料的朋友，可以戳这里获取

9752152)]
[外链图片转存中…(img-bmPVRCIL-1715619752153)]

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化资料的朋友，可以戳这里获取

2401_84592111

关注

4
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
2024年大数据最新大数据之Hadoop图解概述，2024年最新腾讯T2大佬手把手教你

Sqoop 是一款开源的工具，主要用于在 Hadoop、Hive 与传统的数据库（MySQL）间进行数据的传递，可以将一个关系型数据库（例如：MySQL，Oracle 等）中的数据导进到 Hadoop 的 HDFS 中，也可以将 HDFS 的数据导进到关系型数据库中。MapReduce：分布式的离线并行计算框架，对海量数据的处理。：Flume 是一个高可用的，高可靠的，分布式的海量日志采集、聚合和传输的系统，Flume 支持在日志系统中定制各类数据发送方，用于收集数据；首先按照键进行排序，然后按照值。
复制链接

扫一扫