Spark基本原理初识与补充

最新推荐文章于 2023-05-01 13:33:23 发布

「已注销」

最新推荐文章于 2023-05-01 13:33:23 发布

阅读量566

点赞数

分类专栏： Spark 文章标签：大数据 spark

本文链接：https://blog.csdn.net/weixin_38097878/article/details/106124555

版权

本文介绍了Spark的基本原理，包括Application、Driver、Cluster Manager、Executor、RDD和DAG的概念，详细阐述了Spark运行流程。此外，还详细讨论了RDD数据源，如普通文本文件、JDBC、Hadoop API、SequenceFile、对象文件和HBase的使用方法。

摘要由CSDN通过智能技术生成

文章目录

Spark

Spark

Spark基本原理初识

基本概念

http://spark.apache.org/docs/latest/cluster-overview.html
在这里插入图片描述

名词解释

.Application：指的是用户编写的Spark应用程序/代码，包含了Driver功能代码和分布在集群中多个节点上运行的Executor代码。

Driver：Spark中的Driver即运行上述Application的Main()函数并且创建SparkContext，SparkContext负责和ClusterManager通信，进行资源的申请、任务的分配和监控等
Cluster Manager：指的是在集群上获取资源的外部服务，Standalone模式下由Master负责，Yarn模式下ResourceManager负责;
Executor：是运行在工作节点Worker上的进程，负责运行任务，并为应用程序存储数据，是执行分区计算任务的进程；
RDD：Resilient Distributed Dataset弹性分布式数据集，是分布式内存的一个抽象概念；
DAG：Directed Acyclic Graph有向无环图，反映RDD之间的依赖关系和执行流程；
Job：作业，按照DAG执行就是一个作业；Job==DAG
Stage：阶段，是作业的基本调度单位，同一个Stage中的Task可以并行执行，多个Task组成TaskSet任务集
Task：任务，运行在Executor上的工作单元，一个Task计算一个分区，包括pipline上的一系列操作

执行流程

Spark运行基本流程

当一个Spark应用被提交时，首先需要为这个Spark Application构建基本的运行环境，即由任务控制节点(Driver)创建一个SparkContext，
SparkContext向资源管理器注册并申请运行Executor资源；
资源管理器为Executor分配资源并启动Executor进程，Executor运行情况将随着心跳发送到资源管理器上；
SparkContext根据RDD的依赖关系构建成DAG图，并提交给DAGScheduler进行解析划分成Stage，并把该Stage中的Task组成Taskset发送给TaskScheduler。
TaskScheduler将Task发放给Executor运行，同时SparkContext将应用程序代码发放给Executor。
Executor将Task丢入到线程池中执行，把执行结果反馈给任务调度器，然后反馈给DAG调度器，运行完毕后写入数据并释放所有资源。

流程图解
在这里插入图片描述