JobGenerator 详解

最新推荐文章于 2020-09-02 10:22:39 发布

wzsyf

最新推荐文章于 2020-09-02 10:22:39 发布

阅读量400

点赞数

分类专栏： Spark 文章标签： spark

本文链接：https://blog.csdn.net/wzsyf/article/details/105914873

版权

引言
前面在 [Spark Streaming 实现思路与模块概述](0.1 Spark Streaming 实现思路与模块概述.md) 和 [DStream 生成 RDD 实例详解](1.2 DStream 生成 RDD 实例详解.md) 里我们分析了 DStream 和 DStreamGraph 具有能够实例化 RDD 和 RDD DAG 的能力，下面我们来看 Spark Streaming 是如何将其动态调度的。

在 Spark Streaming 程序的入口，我们都会定义一个 batchDuration，就是需要每隔多长时间就比照静态的 DStreamGraph 来动态生成一个 RDD DAG 实例。在 Spark Streaming 里，总体负责动态作业调度的具体类是 JobScheduler，

JobScheduler 有两个非常重要的成员：JobGenerator 和 ReceiverTracker。JobScheduler 将每个 batch 的 RDD DAG 具体生成工作委托给 JobGenerator，而将源头输入数据的记录工作委托给 ReceiverTracker。

JobScheduler的全限定名是：org.apache.spark.streaming.scheduler.JobScheduler
JobGenerator的全限定名是：org.apache.spark.streaming.scheduler.JobGenerator
ReceiverTracker的全限定名是：org.apache.spark.streaming.scheduler.ReceiverTracker

JobGenerator 启动
在用户 code 最后调用 ssc.start() 时，将隐含的导致一系列模块的启动，其中对我们 JobGenerator 这里的启动调用关系如下：

最低0.47元/天解锁文章

wzsyf

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
JobGenerator 详解

引言前面在 [Spark Streaming 实现思路与模块概述](0.1 Spark Streaming 实现思路与模块概述.md) 和 [DStream 生成 RDD 实例详解](1.2 DStream 生成 RDD 实例详解.md) 里我们分析了 DStream 和 DStreamGraph 具有能够实例化 RDD 和 RDD DAG 的能力，下面我们来看 Spark Streaming ...
复制链接

扫一扫