spark 总体架构

spark 架构

源码参考 https://blog.csdn.net/weixin_37850264/category_10688649.html

1、执行流程
Spark-submit 提交application,
driver先构造sparkconf,再构造sparkcontext,
sparkcontext构造DAGScheuler和TaskScheduler,
–TaskScheduler通过他的后台进程(ClientActor)连接master,向master注册application
–Master接收到application的注册请求后,使用自己的资源调度算法,在spark集群的worker上为这个application启动多个–executor
–Executor启动之后会自己反向注册到TaskScheduler (DriverActor)
–所有executor都反向注册到driver上之后,driver结束sparkcontext初始化,后执行代码
每执行到一个action就会创建一个job,提交到DagScheduler,
DagScheduler会将job划分为多个stage,然后每个stage创建一个taskset
TaskScheduler会把taskset的每个task提交到executor上执行
Executor每接收到一个task都会用taskrunner来封装task,然后从线程池中取出一个线程来执行(taskrunner将我们编写的代码,也就是执行的算子以及函数,拷贝,反序列化,然后执行task)
Task有两种,ShuffleMapTask和ResultTask,只有最后一个stage是ResultTask,之前的stage都是ShuffleMapTask
整个spark应用程序的执行,就是stage分批次作为taskset提交到executor执行,每个task针对RDD的一个partition,执行我们定义的算子和函数,以此类推,直到所有操作执行完为止

2、spark yarn提交
yarn-cluster:
Spark-submit 发送请求到resourcemanager,请求启动applicationMaster
Resoucemanager分配container在某个nodemanager上启动applicationMaster
applicationMaster相当于driver
AM找RM,请求container,启动executor
AM连接其他NM,来启动executor,(NM相当于worker)
Executor启动后向AM反向注册
yarn-client:
Driver在本地启动

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 3
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值