Hadoop企业优化

最新推荐文章于 2023-07-19 16:41:20 发布

weixin_47621995

最新推荐文章于 2023-07-19 16:41:20 发布

阅读量51

点赞数

本文链接：https://blog.csdn.net/weixin_47621995/article/details/107590816

版权

1 MapReduce 跑的慢的原因

在这里插入图片描述

2 MapReduce优化方法

MapReduce优化方法主要从六个方面考虑：数据输入、Map阶段、Reduce阶段、IO传输、数据倾斜问题和常用的调优参数。

2.1 数据输入

在这里插入图片描述

2.2 Map阶段

在这里插入图片描述

2.3 Reduce阶段

在这里插入图片描述

2.4 I/O传输

在这里插入图片描述

2.5 数据倾斜问题

在这里插入图片描述

3 常用的调优参数

1）资源相关参数

（1）以下参数是在用户自己的MR应用程序中配置就可以生效（mapred-default.xml）

在这里插入图片描述

（2）应该在YARN启动之前就配置在服务器的配置文件中才能生效（yarn-default.xml）

在这里插入图片描述

（3）Shuffle性能优化的关键参数，应在YARN启动之前就配置好（mapred-default.xml）

在这里插入图片描述

2）容错相关参数（MapReduce性能优化）

在这里插入图片描述

4 Hadoop小文件优化方法

4.1 Hadoop小文件弊端

HDFS上每个文件都要在NameNode上创建对应的元数据，这个元数据的大小约为150byte，这样当小文件比较多的时候，就会产生很多的元数据文件，一方面会大量占用NameNode的内存空间，另一方面就是元数据文件过多，使得寻址索引速度变慢。
小文件过多，在进行MR计算时，会生成过多切片，需要启动过多的MapTask。每个MapTask处理的数据量小，导致MapTask的处理时间比启动时间还小，白白消耗资源。

4.2 Hadoop小文件解决方案

小文件优化的方向：
（1）在数据采集的时候，就将小文件或小批数据合成大文件再上传HDFS。
（2）在业务处理之前，在HDFS上使用MapReduce程序对小文件进行合并。
（3）在MapReduce处理时，可采用CombineTextInputFormat提高效率。
（4）开启uber模式，实现jvm重用
Hadoop Archive
是一个高效的将小文件放入HDFS块中的文件存档工具，能够将多个小文件打包成一个HAR文件，从而达到减少NameNode的内存使用
SequenceFile
SequenceFile是由一系列的二进制k/v组成，如果为key为文件名，value为文件内容，可将大批小文件合并成一个大文件
CombineTextInputFormat
CombineTextInputFormat用于将多个小文件在切片过程中生成一个单独的切片或者少量的切片。
开启uber模式，实现jvm重用。默认情况下，每个Task任务都需要启动一个jvm来运行（启动一个jvm即开始一个一个contain），如果Task任务计算的数据量很小，我们可以让同一个Job的多个Task运行在一个Jvm中，不必为每个Task都开启一个Jvm.
开启uber模式，在mapred-site.xml中添加如下配置

<!--  开启uber模式 -->
<property>
  <name>mapreduce.job.ubertask.enable</name>
  <value>true</value>
</property>

<!-- uber模式中最大的mapTask数量，可向下修改  --> 
<property>
  <name>mapreduce.job.ubertask.maxmaps</name>
  <value>9</value>
</property>
<!-- uber模式中最大的reduce数量，可向下修改 -->
<property>
  <name>mapreduce.job.ubertask.maxreduces</name>
  <value>1</value>
</property>
<!-- uber模式中最大的输入数据量，默认使用dfs.blocksize 的值，可向下修改 -->
<property>
  <name>mapreduce.job.ubertask.maxbytes</name>
  <value></value>
</property>

weixin_47621995

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Hadoop企业优化

1 MapReduce 跑的慢的原因2 MapReduce优化方法MapReduce优化方法主要从六个方面考虑：数据输入、Map阶段、Reduce阶段、IO传输、数据倾斜问题和常用的调优参数。2.1 数据输入2.2 Map阶段2.3 Reduce阶段2.4 I/O传输2.5 数据倾斜问题3 常用的调优参数1）资源相关参数（1）以下参数是在用户自己的MR应用程序中配置就可以生效（mapred-default.xml）（2）应该在YARN启动之前就配置在服务器的配置文件中
复制链接

扫一扫