Hadoop(四) -- MapReducer(二)maptask和reducetask并行度

一、MapTask的并行度

        运行map部分的任务叫做maptask,并行度是指同时运行的maptask的任务个数。maptask处理的数据量对应于一个文件切片,每个maptask处理一个文件切片大小的数据。

        MapReducer任务运行时通过 FileInputFormat 类传入输入数据文件,该类在读取文件时会调用 getSplit() 方法对文件进行逻辑切片。

        getSplit() 部分源码如下,当使用默认配置时切片大小默认等于HDFS分块大小128M

/** 
   * Generate the list of files and make them into FileSplits.
   * @param job the job context
   * @throws IOException
   */
  public List<InputSplit> getSplits(JobContext job) throws IOException {
    long minSize = Math.max(getFormatMinSplitSize(), getMinSplitSize(job));  // 1
    long maxSize = getMaxSplitSize(job);  // LONG_MAX_VALUE
    
    // 块的切分标准,Hadoop2.x 默认128M
    long blockSize = file.getBlockSize();
    // 计算切片大小
    long splitSize = computeSplitSize(blockSize, minSize, maxSize);
  }

  // 返回三个值得中间值
  protected long computeSplitSize(long blockSize, long minSize, long maxSize) {
        return Math.ma
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值