MapReduce中Job提交流程源码和切片源码小结

MapReduce定义

​ MapReduce是一个分布式运算程序的编程框架,是用户开发“基于Hadoop的数据分析应用”的核心框架。 MapReduce核心功能是将用户编写的业务逻辑代码和自带默认组件整合成一个完整的分布式运算程序,并发运行在一个Hadoop集群上。

MapReduce的核心思想
  1. 首先MapReduce分成两个阶段:Map阶段和Reduce阶段。
  2. 在Map阶段,会并发的执行MapTask。
  3. 在Reduce阶段,会有并发的ReduceTask。ReduceTask依赖于MapTask并发输出的结果。

举个例子:手写wordCount例子

  1. 首先inputFormat会对数据块进行切片,如果是TextInputFormat,每个切片默认就是每个block的大小(本地是33554432字节/32M,集群上默认是128M),然后每个切片会对应一个MapTask,MapTask会按行读取数据,然后用空格进行分割行内的单词,再用每个单词对应整数1组成K/V键值对,最后按照 单词首字母进行分区,分成两个区,再写入磁盘。当数据到Reduce阶段时,会产生两个 ReduceTask并行地统计这两个分区中的数据。
Job提交流程源码和切片源码

数据切片是MapReduce程序计算输入数据的单位,一个切片会对应启动一个MapTask。

Job提交流程源码
waitForCompletion():
-->
    submit();
-->
// 1建立连接
	connect();	
		// 1)创建提交Job的代理
		new Cluster(getConfiguration());
			// (1)判断是本地运行环境还是yarn集群运行环境
			initialize(jobTrackAddr, conf); 

// 2 提交job
submitter.submitJobInternal(Job.this, cluster)
	// 1)创建给集群提交数据的Stag路径
	Path jobStagingArea = JobSubmissionFiles.getStagingDir(cluster, conf);

	// 2)获取jobid ,并创建Job路径
	JobID jobId = submitClient.getNewJobID();

	// 3)拷贝jar包到集群
	copyAndConfigureFiles(job, submitJobDir);	
	rUploader.uploadFiles(job, jobSubmitDir);

	// 4)计算切片,生成切片规划文件
	writeSplits(job, submitJobDir);
		maps = writeNewSplits(job, jobSubmitDir);
		input.getSplits(job);

	// 5)向Stag路径写XML配置文件
	writeConf(conf, submitJobFile);
	conf.writeXml(out);

	// 6)提交Job,返回提交状态
status = submitClient.submitJob(jobId, submitJobDir.toString(), job.getCredentials());

上面的步骤3,步骤4,步骤5分别会在I:\tmp\hadoop\mapred\staging\atguigu78585000.staging\job_local78585000_0001生成三种文件:

  1. 切片文件
  2. 配置文件
  3. Jar包(如果是集群下才会有jar包,本地运行环境下没有)

在这里插入图片描述

FileInputFormat切片原理

在这里插入图片描述

  1. 切片大小默认是Block大小。(本地环境是33554432字节/32M,集群环境下是128M)
  2. 切片的大小可以设置,公式为:Math.max(minSize, Math.min(maxSize, blockSize))

从上面的debug可看出minSize =1 ,maxSize等于long型的最大值,所以此时切片大小默认就是block的大小

如果要调整切片的大小,就只要调整minSize和MaxSize就可以了。调小,可以让MaxSize变小(小于Block)。调大,可以让MinSize变大(大于Block).

ze和MaxSize就可以了。调小,可以让MaxSize变小(小于Block)。调大,可以让MinSize变大(大于Block).

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值