MapReduce 的优化

最新推荐文章于 2023-05-15 20:53:04 发布

萌萌哒的理工男

最新推荐文章于 2023-05-15 20:53:04 发布

阅读量345

点赞数

分类专栏： Hadoop # MapReduce 文章标签： MapReduce mr 优化

本文链接：https://blog.csdn.net/qq_38924171/article/details/100635969

版权

Hadoop 同时被 2 个专栏收录

22 篇文章 1 订阅

订阅专栏

MapReduce

8 篇文章 0 订阅

订阅专栏

MR的优化

MapReduce优化方法主要从六个方面考虑：

数据输入
Map阶段
Reduce阶段
IO传输
数据倾斜问题
常用的调优参数。

数据输入

合并小文件:在执行MR任务前将小文件进行合并,大量的小文件会产生大量的Map任务,增大map任务装载次数,而任务的装载比较耗时,从而导致mr运行较慢.
采用CombineTextInputFormat来作为输入,解决输入端大量小文件场景. job.setCombineTextInputFormat(job,文件大小)

Map阶段

减少溢写(Spill)次数: 通过调整io.sort.mb及sort.spill.percent参数值,增大触发Spill的内存上限,减少 Spill次数,从而减少磁盘IO.
减少合并(Merge)次数: 通过调整io.sort.factor参数,增大Merge的文件数目,减少Merge的次数,从而缩短MR处理时间.
在Map之后,不影响业务逻辑前提下,先进行Combine处理,减少I/O.

Reduce阶段

合理设置Reduce端的Buﬀer:默认情况下,数据达到一个阈值的时候,Buﬀer中的数据就会写入磁盘,然后 Reduce会从磁盘中获得所有的数据.也就是说,Buﬀer和Reduce是没有直接关联的,中间多次写磁盘->读磁盘的过程,既然有这个弊端,那么就可以通过参数来配置,使得Buﬀer中的一部分数据可以直接输送到 Reduce,从而减少I/O开销。

mapreduce.reduce.input.buﬀer.percent,默认为0.0. 当值大于0的时候,会保留指定比例的内存读Buﬀer中的数据直接拿给Reduce使用.这样一来,设置Buﬀer需要内存,读取数据需要内存, Reduce计算也要内存,所以要根据作业的运行情况进行调整。(Oozie,Azkaban)

IO传输

采用数据压缩的方式,减少网络IO的时间. 安装Snappy和LZO压缩编码器.
使用SequenceFile二进制文件.

数据倾斜问题

数据倾斜现象:

数据频率倾斜--某一个区域的数据量要远远大于其他区域.
数据大小倾斜--部分记录的大小远远大于平均值.

减少数据倾斜的方法

方法1: 抽样和范围区域

可以通过对原始数据进行抽样得到的结果集来预设分区边界值.

方法2: 自定义分区

基于输出键的背景知识进行自定义分区.例如,如果Map输出键的关键词来源于一本书. 且其中某几个专业词汇较多,那么就可以自定义分区将这些专业词汇发送给固定一部分的Reduce实例,而将其他的都发送给剩余的Reduce实例.

方法3: Combine

使用Combine可以大量地减小数据倾斜.在可能的情况下,Combine的目的就是聚合并精简数据.

方法4: 采用Map Join,尽量避免Reduce Join.

优化HDFS小文件的问题

HDFS小文件弊端 HDFS上每个文件都要在NameNode上建立一个索引,这个索引的大小约为150byte,这样当小文件比较多的时候,就会产生很多索引文件,一方面会大量占用NameNode的内存空间,另一方面就是索引文件过大使得索引速度变慢.

小文件的优化无非有以下几种方式:

在数据采集的时候,就将小文件或小批数据合成大文件再上传HDFS.
在业务处理之前,在HDFS上使用MapReduce程序对小文件进行合并.
在MapReduce处理时,可采用CombineTextInputFormat提高效率.

常用的调优参数

资源相关

属性	描述
mapreduce.map.memory.mb	一个Map Task可使用的资源上限（单位:MB），默认为1024。如果 Map Task实际使用的资源量超过该值，则会被强制杀死。
mapreduce.reduce.memory.mb	一个Reduce Task可使用的资源上限（单位:MB），默认为 1024。如果Reduce Task实际使用的资源量超过该值，则会被强制杀死。
mapreduce.map.cpu.vcores	每个Map task可使用的最多cpu core数目, 默认值: 1
mapreduce.reduce.cpu.vcores	每个Reduce task可使用的最多cpu core数目, 默认值: 1
mapreduce.map.java.opts	Map Task的JVM参数，你可以在此配置默认的java heap size等参数
mapreduce.reduce.java.opts	Reduce Task的JVM参数，你可以在此配置默认的java heap size等参数
yarn.scheduler.minimum-allocation-mb	给应用程序container分配的最小内存，默认1024
yarn.scheduler.maximum-allocation-mb	给应用程序container分配的最大内存，默认8192
yarn.scheduler.minimum-allocation-vcore	默认1
yarn.scheduler.maximum-allocation-vcores	默认32
yarn.nodemanager.resource.memory-mb	每台NodeManager最大可用内存，默认8192
yarn.nodemanager.resource.cpu-vcores	每台NodeManager最大可用cpu核数，默认8
mapreduce.task.io.sort.mb	shuﬄe的环形缓冲区大小，默认100m
mapreduce.map.sort.spill.percent	环形缓冲区溢出的阈值，默认80%

容错相关

属性	描述
mapreduce.map.maxattempts	每个Map Task最大重试次数，一旦重试参数超过该值，则认为 Map Task运行失败，默认值：4
mapreduce.reduce.maxattempts	每个Reduce Task最大重试次数，一旦重试参数超过该值，则认为Map Task运行失败，默认值：4
mapreduce.map.failures.maxpercent	当失败的Map Task失败比例超过该值为，整个作业则失败，默认值为0. 如果你的应用程序允许丢弃部分输入数据，则该该值设为一个大于0的值，比如5，表示如果有低于5%的Map Task失败（如果一个Map Task重试次数超过mapreduce.map.maxattempts，则认为这个Map Task失败，其对应的输入数据将不会产生任何结果），整个作业扔认为成功
mapreduce.reduce.failures.maxpercent	当失败的Reduce Task失败比例超过该值为，整个作业则失败，默认值为0
mapreduce.task.timeout	Task超时时间，经常需要设置的一个参数，该参数表达的意思为：如果一个task在一定时间内没有任何进入，即不会读取新的数据，也没有输出数据，则认为该task处于block 状态，可能是卡住了，也许永远会卡主，为了防止因为用户程序永远block住不退出，则强制设置了一个该超时时间（单位毫秒），默认是300000。如果你的程序对每条输入数据的处理时间过长（比如会访问数据库，通过网络拉取数据等），建议将该参数调大，该参数过小常出现的错误提示是“AttemptID:attempt_14267829456721_123456_m_000224_0 Timed out after 300 secsContainer killed by the ApplicationMaster.”

萌萌哒的理工男

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
MapReduce 的优化

MR的优化MapReduce优化方法主要从六个方面考虑：数据输入 Map阶段 Reduce阶段 IO传输数据倾斜问题常用的调优参数。数据输入合并小文件:在执行MR任务前将小文件进行合并,大量的小文件会产生大量的Map任务,增大map任务装载次数,而任务的装载比较耗时,从而导致mr运行较慢. 采用CombineTextInputFormat来作为输入,解决输入端...
复制链接

扫一扫