大数据MapReduce的性能调优方法总结

最新推荐文章于 2023-05-05 14:37:54 发布

让你五行代码

最新推荐文章于 2023-05-05 14:37:54 发布

阅读量642

点赞数

分类专栏： Python大数据文章标签：大数据 mapreduce hadoop

原文链接：https://www.itheima.com/news/20201118/143040.html

版权

Python大数据专栏收录该内容

85 篇文章

订阅专栏

本文介绍了在处理大数据时，对HadoopMapReduce进行性能优化的重要性，特别是Shuffle阶段的参数配置。调优策略包括合并小文件、减少Map和Reduce阶段的溢写与合并次数、合理设置任务数量、优化Shuffle内存使用以及调整其他基本资源属性。这些优化方法旨在减少IO操作，提升处理效率。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

使用Hadoop进行大数据运算，当数据量极其大时，那么对MapReduce性能的调优重要性不言而喻，尤其是Shuffle过程中的参数配置对作业的总执行时间影响特别大。下面总结一些和MapReduce相关的性能调优方法，主要从五个方面考虑：数据输入、Map阶段、Reduce阶段、Shuffle阶段和其他调优属性。

　　1.数据输入

　　在执行MapReduce任务前，将小文件进行合并，大量的小文件会产生大量的map任务，增大map任务装载的次数，而任务的装载比较耗时，从而导致MapReduce运行速度较慢。因此我们采用CombineTextInputFormat来作为输入，解决输入端大量的小文件场景。

　　2.Map阶段

　　(1)减少溢写(spill)次数：通过调整io.sort.mb及sort.spill.percent参数值，增大触发spill的内存上限，减少spill次数，从而减少磁盘IO。

　　(2)减少合并(merge)次数：通过调整io.sort.factor参数，增大merge的文件数目，减少merge的次数，从而缩短mr处理时间。

　　(3)在map之后，不影响业务逻辑前提下，先进行combine处理，减少 I/O。

　　我们在上面提到的那些属性参数，都是位于mapred-default.xml文件中，这些属性参数的调优方式如表1所示。

　　表1 Map阶段调优属性

　　3.Reduce阶段

　　(1)合理设置map和reduce数：两个都不能设置太少，也不能设置太多。太少，会导致task等待，延长处理时间;太多，会导致 map、reduce任务间竞争资源，造成处理超时等错误。

　　(2)设置map、reduce共存：调整slowstart.completedmaps参数，使map运行到一定程度后，reduce也开始运行，减少reduce的等待时间。

　　(3)规避使用reduce：因为reduce在用于连接数据集的时候将会产生大量的网络消耗。通过将MapReduce参数setNumReduceTasks设置为0来创建一个只有map的作业。

　　(4)合理设置reduce端的buffer：默认情况下，数据达到一个阈值的时候，buffer中的数据就会写入磁盘，然后reduce会从磁盘中获得所有的数据。也就是说，buffer和reduce是没有直接关联的，中间多一个写磁盘->读磁盘的过程，既然有这个弊端，那么就可以通过参数来配置，使得buffer中的一部分数据可以直接输送到reduce，从而减少IO开销。这样一来，设置buffer需要内存，读取数据需要内存，reduce计算也要内存，所以要根据作业的运行情况进行调整。

　　我们在上面提到的属性参数，都是位于mapred-default.xml文件中，这些属性参数的调优方式如表2所示。

　　表2 Reduce阶段的调优属性