MapReduce调度与执行原理之任务调度（续）

最新推荐文章于 2022-03-11 15:04:54 发布

择思

最新推荐文章于 2022-03-11 15:04:54 发布

阅读量3.6k

点赞数

分类专栏： Hadoop技术 Hadoop源码学习研究

本文链接：https://blog.csdn.net/jaytalent/article/details/11708637

版权

本文深入解析了Hadoop MapReduce中JobTracker在接收到TaskTracker心跳后如何选择和调度任务的过程。作业生命周期分为5个阶段：提交与初始化、任务调度与监控、任务运行环境准备、任务执行和作业完成。任务调度遵循三级调度模型，从队列选择任务并考虑数据本地性、负载均衡和推测执行。任务选择优先考虑数据本地性和失败任务，然后是非本地任务。心跳响应中包含JobTracker对TaskTracker的指令，如启动任务、杀任务和作业清理等。

摘要由CSDN通过智能技术生成

前言：本文旨在理清在Hadoop中一个MapReduce作业（Job）在提交到框架后的整个生命周期过程，权作总结和日后参考，如有问题，请不吝赐教。本文不涉及Hadoop的架构设计，如有兴趣请参考相关书籍和文献。在梳理过程中，我对一些感兴趣的源码也会逐行研究学习，以期强化基础。
作者：Jaytalent
开始日期 ：2013年9月9日
参考资料：【1】《Hadoop技术内幕--深入解析MapReduce架构设计与实现原理》董西成

【2】 Hadoop 1.0.0 源码

【3】《Hadoop技术内幕--深入解析Hadoop Common和HDFS架构设计与实现原理》蔡斌陈湘萍

继续上一篇文章的话题，说说调度器的任务选择机制。

一个MapReduce作业的生命周期大体分为5个阶段【1】：

1. 作业提交与初始化

2. 任务调度与监控

3. 任务运行环境准备

4. 任务执行

5. 作业完成

当JobTracker收到了来自TaskTracker的心跳后，是如何选择任务的呢？是通过assignTasks方法。下面详细分析该方法。在分析之前，首先提一下Hadoop的调度器调度模型。通常情况下，Hadoop会以队列为单位管理作业和资源。有了队列就产生所谓三级调度模型：调度器依次选择一个队列，队列中的一个作业，作业中的一个任务，最终将任务分配给有空闲slot的TaskTracker。assignTasks的实现也遵循这个模型：

    Collection<JobInProgress> jobQueue = jobQueueJobInProgressListener.getJobQueue();

对于FIFO调度器而言，队列即为对应监听器中使用的作业队列。然后，声明一个列表，用于保存选择的任务：

    // Assigned tasks
    List<Task> assignedTasks = new ArrayList<Task>();

接下来，计算队列中正在运行的和等待运行的map和reduce任务的数量：

    // Compute (running + pending) map and reduce task numbers across pool
    int remainingReduceLoad = 0;
    int remainingMapLoad = 0;
    synchronized (jobQueue) {
      for (JobInProgress job : jobQueue) {
        if (job.getStatus().getRunState() == JobStatus.RUNNING) {
          remainingMapLoad += (job.desiredMaps() - job.finishedMaps());
          if (job.scheduleReduces()) {
            remainingReduceLoad += 
              (job.desiredReduces() - job.finishedReduces());
          }
        }
      }
    }

其中，job.scheduleReduces方法判断当前map任务的总体进度是否满足reduce任务开始调度的条件，map任务完成的比例是否超过变量mapred.reduce.slowstart.completed.maps的值，若超过则计算reduce任务的剩余任务数。接下来，计算map和reduce任务的负载因子：

    // Compute the 'load factor' for maps and reduces
    double m

最低0.47元/天解锁文章

择思

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
1
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录