大数据最新完整大数据学习路线，看了就会有所收获_大数据分析学习路线，2024年最新超全大数据开发中高级面试复习大纲

最新推荐文章于 2024-05-31 14:54:28 发布

2401_84183545

最新推荐文章于 2024-05-31 14:54:28 发布

阅读量596

点赞数 30

分类专栏：程序员文章标签：大数据面试学习

本文链接：https://blog.csdn.net/2401_84183545/article/details/138736391

版权

程序员专栏收录该内容

124 篇文章 0 订阅

订阅专栏

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上大数据知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

需要这份系统化资料的朋友，可以戳这里获取

	- [6.4 Lucene基础](#64__Lucene_410)
	- [6.5 Solr基础](#65__Solr_423)
	- [6.6 Federation](#66__Federation_441)
+ [7.总结](#7_445)
+ [8.其他方向](#8_475)
+ [9.项目案例](#9_479)

大数据学习路线

大数据的本质：两个

大数据的存储——分布式文件存储
大数据的计算——分布式计算

大数据核心框架：两个

Hadoop——基于Java语言开发
Spark——基于Scala语言开发，Scala语言基于Java语言。Spark支持Java语言，但使用Scala语言更优。

1.Java基础——主要部分是JavaSE

1.1 Java初级

基本语法
类
封装
继承
多态

注：
1.主要指的是JavaSE部分。对于JavaEE(企业级应用，例Tomcat的使用)部分和JavaME(主要应用方向是嵌入式领域，目前大有被Android所替代的趋势)部分，不做掌握要求。JavaEE和JavaME两部分的基础也是JavaSE。
2.Java中没有函数的概念，C/C++中的函数在Java中成为方法，方法中的参数也称为形参，在方法的定义中，是不能使用其他方法作为形参的，但是在方法的调用中，是可以使用方法作为参数的，前提是该方法的返回值必须与形参所定义的值类型一致。

1.2 Java高级

Java多线程基本知识
Java同步关键词详解
java并发包线程池及在开源软件中的应用
Java并发包消息队里及在开源软件中的应用
Java JMS技术
Java动态代理反射
I/O流
泛型

1.3 其余常见基础…

2.Linux基础——主要指的是Linux基本命令操作

Linux的介绍，Linux的安装：VMware Workstation虚拟软件安装过程、CentOS虚拟机安装过程
Linux的常用命令：常用命令的介绍、常用命令的使用和练习：包括文件/目录常见操作、用户管理与权限、免密登陆配置与网络管理。
Linux系统进程管理基本原理及相关管理工具如ps、pkill、top、htop等的使用；
Linux启动流程，运行级别详解，chkconfig详解
VI、VIM编辑器：VI、VIM编辑器的介绍、VI、VIM扥使用和常用快捷键
Linux磁盘管理，lvm逻辑卷，nfs详解
Linux系统文件权限管理：文件权限介绍、文件权限的操作
Linux的RPM软件包管理：RPM包的介绍、RPM安装、卸载等操作
yum命令，yum源搭建
Linux网络：Linux网络的介绍、Linux网络的配置和维护防火墙配置
Shell编程：Shell的介绍、Shell脚本的编写
Linux上常见软件的安装：安装JDK、安装Tomcat、安装mysql,web项目部署
linux高级文本处理命令cut、sed、awklinux
定时任务crontab
其余常见操作…

注：目录，在Linux系统中常称为目录，在Windows系统中常称为文件夹，不同称谓同样的性质。

3.Hadoop生态学习（体系结构、原理、编程）

3.1第一阶段

这一阶段是本节的核心，即HDFS(大数据存储)、MapReduce(大数据计算)、HBse(NoSQL数据库)。

Hadoop是一个对海量数据进行处理的分布式系统架构，可以理解为Hadoop就是一个对大量的数据进行分析的工具，和其他组件搭配使用，来完成对大量数据的收集、存储和计算。

有一个基于Hadoop的数据挖掘库——Mahout。

离线计算系统Hadoop体系基础主要内容：
1、Hadoop快速入门
    hadoop背景介绍
    分布式系统概述
    离线数据分析流程介绍
    集群搭建
    集群使用初步

2、HDFS
    HDFS的概念和特性
    HDFS的shell(命令行客户端)操作
    HDFS的工作机制
    NAMENODE的工作机制
    java的api操作
    案例1：开发shell采集脚本

3、MapReduce基础
    自定义Hadoop的RPC框架
    Mapreduce编程规范及示例编写
    Mapreduce程序运行模式及debug方法
    MapReduce程序运行模式的内在机理
    MapReduce运算框架的主体工作流程
    自定义对象的序列化方法
    MapReduce编程案例

4、MapReduce高级
    Mapreduce排序
    自定义partitioner
    Mapreduce的combiner
    mapreduce工作机制详解

5、MapReduce实战
    maptask并行度机制-文件切片
    maptask并行度设置
    倒排索引
    共同好友
    
Hadoop入门——>HDFS/MapReduce基础——>HDFS/MapReduce高级——>HDFS/MapReduce实战

3.2第二阶段

数据分析引擎——Hive(数据仓库工具，不是数据库工具。数据仓库是逻辑上的概念，底层使用的是数据库。)、Pig(Pig是一个基于Hadoop的大规模数据分析平台，它提供的SQL-LIKE语言叫Pig Latin)

数据采集引擎——Flume(实时日志采集)、Sqoop(数据迁移工具，主要用于在Hive数据库与关系型数据库间进行数据的传递，可将关系型数据库中的数据导入Hadoop的HDFS中，也可以将HDFS的数据导进到关系型数据库中。)、DataX(阿里开源)

注：关系型数据库包括，MySQL、Oracle、DB2、Microsoft SQL Server、Microsoft Access、PostgreSQL等。

数据仓库工具Hive基础主要内容：
    1) Hadoop的HA机制
    2) HA集群的安装部署
    3) 集群运维测试之Datanode动态上下线
    4) 集群运维测试之Namenode状态切换管理
    5) 集群运维测试之数据块的balance
    6) HA下HDFS-API变化
    7) hive简介
    8) hive架构
    9) hive安装部署
    10) hvie初使用

Hive高级
    1) HQL-DDL基本语法
    2) HQL-DML基本语法
    3) HIVE的join
    4) HIVE 参数配置
    5) HIVE 自定义函数和Transform
    6) HIVE 执行HQL的实例分析
    7) HIVE最佳实践注意点
    8) HIVE优化策略
    9) HIVE实战案例

分布式日志框架Flume主要内容：
    1) flume简介/介绍-基础知识
    2) flume安装部署与测试
    3) flume部署方式
    4) flume source相关配置及测试
    5) flume sink相关配置及测试
    6) flume selector 相关配置与案例分析
    7) flume Sink Processors相关配置和案例分析
    8) flume Interceptors相关配置和案例分析
    9) flume AVRO Client开发
    10) flume 和kafka 的整合
    11) 案例：采集目录到HDFS
    12) 案例：采集文件到HDFS

数据迁移工具Sqoop主要内容：
    1) 介绍 和 配置Sqoop
    2) Sqoop shell使用
    3) Sqoop-import   a) DBMS-hdfs   b) DBMS-hive   c) DBMS-hbase
    4) Sqoop-export

3.3第三阶段

实现Hadoop的HA(HA是High availability的缩写，即高可用，7*24小时不中断服务)——ZooKeeper(Zookeeper是分布式协调管理服务框架，管理分布式环境中的数据。简要来说，Zookeeper = 文件系统 + 监听通知机制。)

分布式协调管理服务ZooKeeper主要内容：
     1) ZooKeeper简介及应用场景
     2) ZooKeeper集群安装部署
     3) ZooKeeper的数据节点与命令行操作
     4) ZooKeeper的java客户端基本操作及事件监听
     5) ZooKeeper核心机制及数据节点
     6) ZooKeeper应用案例–分布式共享资源锁
     7) ZooKeeper应用案例–服务器上下线动态感知
     8) ZooKeeper的数据一致性原理及leader选举机制

Web管理工具——Hue(Hue是大数据分析交互平台，是大数据web管理器，是运营和开发Hadoop应用的图形化用户界面。其包括三个主要部分:Hue UI，Hue Server，Hue DB。Hue程序被整合到一个类似桌面的环境，以web程序的形式发布，对于单独的用户来说不需要额外的安装。)

工作流引擎——Oozie(Oozie，能够提供对Hadoop的MapReduce和Pig的Jobs任务调度与协调。功能相似的任务调度框架还有Azkaban和Zeus。)

注1：Hadoop-HA严格来说应该分成各个组件的HA机制——HDFS的HA、YARN的HA

注2：大数据四大协作框架——Oozie(任务调度框架)、Sqoop(数据转换工具)、Flume(文件收集库框架)、Hue(大数据Web工具)。

4.Spark生态学习

内存计算Spark基础主要内容：
    1) Spark介绍
    2) Spark应用场景
    3) Spark和Hadoop MR、Storm的比较和优势
    4) RDD
    5) Transformation
    6) Action
    7) Spark计算PageRank
    8) Lineage
    9) Spark模型简介
    10) Spark缓存策略和容错处理
    11) 宽依赖与窄依赖
    12) Spark配置讲解
    13) Spark集群搭建
    14) 集群搭建常见问题解决
    15) Spark原理核心组件和常用RDD
    16) 数据本地性
    17) 任务调度
    18) DAGScheduler
    19) TaskScheduler
    20) Spark源码解读
    21) 性能调优
    22) Spark和Hadoop2.x整合：Spark on Yarn原理

4.1第一阶段

Scala编程

1.Scala是一门多范式(Multi-paradigm)的编程语言，类似Java编程语言，设计初衷是实现可伸缩的语言、并要集成面向对象编程和命令式编程、函数式编程的各种特性。

2.Scala是运行在Java虚拟机上的，并兼容现有Java程序。Scala 源代码被编译成Java字节码，所以它可以运行于JVM之上，并可以调用现有的Java类库。

3.可应用于后端开发，表达能力较强，擅长处理数据，长期运行且吞吐量较大的场景。

编程语言Scala主要内容：
    1) scala解释器、变量、常用数据类型等
    2) scala的条件表达式、输入输出、循环等控制结构
    3) scala的函数、默认参数、变长参数等
    4) scala的数组、变长数组、多维数组等
    5) scala的映射、元组等操作
    6) scala的类，包括bean属性、辅助构造器、主构造器等
    7) scala的对象、单例对象、伴生对象、扩展类、apply方法等
    8) scala的包、引入、继承等概念
    9) scala的特质
    10) scala的操作符
    11) scala的高阶函数
    12) scala的集合
    13) scala数据库连接

4.2第二阶段

Spark Core——基于内存的数据计算，替代的是Hadoop中的MapReduce部分。MapReduce是基于外存的计算，其计算速度较慢、时效性较差。

4.3第三阶段

Spark SQL——类似于Oracle的SQL语句

4.4第四个阶段

Spark Streaming——进行实时计算（流式计算），典型流式计算的生活场景是自来水厂。

流式计算Spark Streaming主要内容：
     1) Spark-Streaming简介
     2) Spark-Streaming编程
     3) 实战：StageFulWordCount
     4) Flume结合Spark Streaming
     5) Kafka结合Spark Streaming
     6) 窗口函数
     7) ELK技术栈介绍
     8) ElasticSearch安装和使用
     9) Storm架构分析
     10) Storm编程模型、Tuple源码、并发度分析
     11) Storm WordCount案例及常用Api分析

5.Storm学习——实时计算

Storm是分布式实时大数据处理框架,是流计算中的佼佼者和主流，被业界称为实时版Hadoop。

和Storm相关的NoSQL数据库，Redis——基于内存的数据库。作用类似Spark Streaming。

实时计算Storm主要内容：
    1) Storm的基本概念
    2) Storm的应用场景


![img](https://img-blog.csdnimg.cn/img_convert/7bc165a963d5f55452e4800961f0724a.png)
![img](https://img-blog.csdnimg.cn/img_convert/38bbd1788b318c24b2492982e85ad112.png)

**网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。**

**[需要这份系统化资料的朋友，可以戳这里获取](https://bbs.csdn.net/forums/4f45ff00ff254613a03fab5e56a57acb)**


**一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！**

Spark Streaming。
> 
> 
>

实时计算Storm主要内容：
1) Storm的基本概念
2) Storm的应用场景

[外链图片转存中…(img-mk0KrGWi-1715449395114)]
[外链图片转存中…(img-Epl7AMQ1-1715449395114)]

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化资料的朋友，可以戳这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

2401_84183545

关注

30
点赞
踩
16

收藏

觉得还不错? 一键收藏
0
评论
大数据最新完整大数据学习路线，看了就会有所收获_大数据分析学习路线，2024年最新超全大数据开发中高级面试复习大纲

实现Hadoop的HA(HA是High availability的缩写，即高可用，7*24小时不中断服务)——ZooKeeper(Zookeeper是分布式协调管理服务框架，管理分布式环境中的数据。数据采集引擎——Flume(实时日志采集)、Sqoop(数据迁移工具，主要用于在Hive数据库与关系型数据库间进行数据的传递，可将关系型数据库中的数据导入Hadoop的HDFS中，也可以将HDFS的数据导进到关系型数据库中。和Storm相关的NoSQL数据库，Redis——基于内存的数据库。
复制链接

扫一扫