切片和maptask并行度决定机制

maptask指的是在mapreduce运行过程中为每一个数据切片分配的数据运算实例任务。maptask的并行度也就指的是运算任务实例的数量,影响整个job的处理速度。

切片与maptask并行度的决定机制

**数据块:**Block是HDFS物理上把数据分成一块一块。

**数据切片:**数据切片只是在逻辑上对输入进行分片,并不会在磁盘上将其切分成片进行存储。

对于一个要处理的文件数据map框架有默认的切片大小,一般默认为blocksize的大小,在分配maptask运算任务实例的时候对每一个数据切片分配一个maptask,这样的话若一个文件的大小没有达到blocksize的大小的时候(比如说文件大小只有1k),那当然就会为了减少资源浪费默认分配一个maptask。

  1. 一个job的map阶段有客户端在提交job时的切片数决定。
  2. 每一个数据切片,split切片分配一个maptask实例处理。
  3. 默认情况下切片大小默认为blocksize。(如果说不是blocksize的话,与datanode中存储的数据块大小不相符,那么在maptask阶段,就需要进行datanode之间的数据传输,大大增加了io操作耗费的时间。)
  4. 切片时不考虑数据集整体,而是逐个对每一个文件进行切片。

[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-CKgHYqus-1603113650855)(https://s1.ax1x.com/2020/10/13/0fLXLD.png)]

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值