MapReduce之切片

MapReduce之切片1 切片与MapTask并行度决定机制1)问题引出​ MapTask的并行度决定Map阶段的任务处理并发度,进而影响到整个Job的处理速度。​ 思考:1G的数据,启动8个MapTask,可以提高集群的并发处理能力。那么1K的数据,也启动8个MapTask,会提高集群性能吗?MapTask并行任务是否越多越好呢?哪些因素影响了MapTask并行度?2)MapTask并行度决定机制​ **数据块:**Block是HDFS物理上把数据分成一块一块。数据块是HDFS存储
摘要由CSDN通过智能技术生成

MapReduce之切片

1 切片与MapTask并行度决定机制

1)问题引出

​ MapTask的并行度决定Map阶段的任务处理并发度,进而影响到整个Job

的处理速度。

​ 思考:1G的数据,启动8个MapTask,可以提高集群的并发处理能力。那

么1K的数据,也启动8个MapTask,

会提高集群性能吗?MapTask并行任务是否越多越好呢?哪些因素影响了

MapTask并行度?

2)MapTask并行度决定机制

​ **数据块:**Block是HDFS物理上把数据分成一块一块。数据块是

HDFS存储数据单位。

​ **数据切片:**数据切片只是在逻辑上对输入进行分片,并不会在磁盘上

将其切分成片进行存储。数据切片是

MapReduce程序计算输入数据的单位,一个切片会对应启动一个

MapTask。

3)切片的一般规则

​ (1)一个Job的Map阶段并行度由客户端在提交Job时的切片数决定

​ (2)每一个Spilt切片分配一个MapTask并行势力处理

​ (3)默认情况下,切片大小 = BlockSize

​ (4)切片时不考虑数据集整体,而是逐个针对每一个文件单独切片

2 Job提交流程源码和切片源码详解

1)Job提交流程源码详解
waitForCompletion()

submit();

	// 1建立连接
	connect();	
		// 1)创建提交Job的代理
		new Cluster(getConfiguration());
			// (1)判断是本地运行环境还是yarn集群运行环境
			initialize(jobTrackAddr, conf); 

	// 2 提交job
	submitter.submitJobInternal(Job.this, cluster)
	// 1)创建给集群提交数据的Stag路径
	Path jobStagingArea = JobSubmissionFiles.getStagingDir(cluster, conf);

	// 2)获取jobid ,并创建Job路径
	JobID jobId = submitClient.getNewJobID();

	// 3)拷贝jar包到集群
	copyAndConfigureFiles(job, submitJobDir);	
	rUploader.uploadFiles(job, jobSubmitDir);

	// 4)计算切片,生成切片规划文件
	writeSplits(job, submitJobDir);
		maps = writeNewSplits(job, jobSubmitDir);
		input.getSplits(job);

	// 5)向Stag路径写XML配置文件
	writeConf(conf, submitJobFile);
	conf.writeXml(out);

	// 6)提交Job,返回提交状态
	status = submitClient.submitJob(jobId, submitJobDir.toString(), job.getCredentials());

Job提交流程源码重点关注:

如果在本地运行,两个重点:切片信息,配置信息;

如果在集群上运行,三个重点:切片信息,配置信息和依赖的jar包。

2)FileInputFormat切片源码解析(input.getSplit(job))

(1)程序先找到数据存储的目录

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值