hadoop调优之数据倾斜和小文件问题

最新推荐文章于 2024-03-22 03:05:18 发布

後弛

最新推荐文章于 2024-03-22 03:05:18 发布

阅读量307

点赞数 1

分类专栏： hadoop分享文章标签： hadoop

本文链接：https://blog.csdn.net/qq_54021998/article/details/115979649

版权

hadoop分享专栏收录该内容

4 篇文章 0 订阅

订阅专栏

Hadoop数据倾斜问题
maptask将大量的相同的key分配到同于一个分区中导致reducetask接受的数据大小不均衡,降低mapreduce的运行速度
Hadoop数据倾斜问题解决方案
1)设定自定义分区规则平衡reduce获取的数据
2)使用combiner合并可以大大减少数据倾斜,在可能的情况夏,Combine的目的就是聚合并精简数据
3)采用Map Join,尽量避免使用Reduce Join
4)重新设计key使分区数据比较平衡
Hadoop小文件弊端
HDFS上每个文件都要在NameNode上创建对应的元数据，这个元数据的大小约为150byte，这样当小文件比较多的时候，就会产生很多的元数据文件，一方面会大量占用NameNode的内存空间，另一方面就是元数据文件过多，使得寻址索引速度变慢。
小文件过多，在进行MR计算时，会生成过多切片，需要启动过多的MapTask。每个MapTask处理的数据量小，导致MapTask的处理时间比启动时间还小，白白消耗资源。
Hadoop小文件解决方案

小文件优化的方向：
（1）在数据采集的时候，就将小文件或小批数据合成大文件再上传HDFS。
（2）在业务处理之前，在HDFS上使用MapReduce程序对小文件进行合并。
（3）在MapReduce处理时，可采用CombineTextInputFormat提高效率。
（4）开启uber模式，实现jvm重用
Hadoop Archive
是一个高效的将小文件放入HDFS块中的文件存档工具，能够将多个小文件打包成一个HAR文件，从而达到减少NameNode的内存使用
SequenceFile
SequenceFile是由一系列的二进制k/v组成，如果为key为文件名，value为文件内容，可将大批小文件合并成一个大文件
CombineTextInputFormat
CombineTextInputFormat用于将多个小文件在切片过程中生成一个单独的切片或者少量的切片。
开启uber模式，实现jvm重用。默认情况下，每个Task任务都需要启动一个jvm来运行，如果Task任务计算的数据量很小，我们可以让同一个Job的多个Task运行在一个Jvm中，不必为每个Task都开启一个Jvm.
开启uber模式，在mapred-site.xml中添加如下配置

<!--  开启uber模式 -->
<property>
  <name>mapreduce.job.ubertask.enable</name>
  <value>true</value>
</property>

<!-- uber模式中最大的mapTask数量，可向下修改  --> 
<property>
  <name>mapreduce.job.ubertask.maxmaps</name>
  <value>9</value>
</property>
<!-- uber模式中最大的reduce数量，可向下修改 -->
<property>
  <name>mapreduce.job.ubertask.maxreduces</name>
  <value>1</value>
</property>
<!-- uber模式中最大的输入数据量，默认使用dfs.blocksize 的值，可向下修改 -->
<property>
  <name>mapreduce.job.ubertask.maxbytes</name>
  <value></value>
</property>

後弛

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
1
评论
hadoop调优之数据倾斜和小文件问题

Hadoop数据倾斜问题maptask将大量的相同的key分配到同于一个分区中导致reducetask接受的数据大小不均衡,降低mapreduce的运行速度Hadoop数据倾斜问题解决方案1)设定自定义分区规则平衡reduce获取的数据2)使用combiner合并可以大大减少数据倾斜,在可能的情况夏,Combine的目的就是聚合并精简数据3)采用Map Join,尽量避免使用Reduce Join4)重新设计key使分区数据比较平衡Hadoop小文件弊端HDFS上每个文件都要在NameNod
复制链接

扫一扫