hive数据优化

最新推荐文章于 2024-05-14 00:15:00 发布

qq_34124060

最新推荐文章于 2024-05-14 00:15:00 发布

阅读量245

点赞数

分类专栏： hive 文章标签： hive

本文链接：https://blog.csdn.net/qq_34124060/article/details/80670307

版权

hive 专栏收录该内容

3 篇文章 0 订阅

订阅专栏

影响Mapper的数量
1）文件数量
2）文件大小，根据下面参数进行切割
set mapred.max.split.size=128000000

影响Reducer数量
mapred.reduce.tasks(强制指定reduce的任务数量)
hive.exec.reducers.bytes.per.reducer（每个reduce任务处理的数据量，默认为1000^3=1G）
hive.exec.reducers.max（每个任务最大的reduce数，默认为999）
计算reducer数的公式很简单N=min( hive.exec.reducers.max ，总输入数据量/ hive.exec.reducers.bytes.per.reducer )

Join优化
1、多表Join时，大表放在最后，小表在前
2、小表使用MapJoin
小于25M的表转为MapJoin，参数调整：
set hive.mapjoin.smalltable.filesize=25000000
set hive.auto.convert.join=true; 默认开启

Group By优化
如果出现数据倾斜，应当做如下处理：
set hive.exec.reducers.max=200;
set mapred.reduce.tasks= 200;
—增大Reduce个数

set hive.groupby.mapaggr.checkinterval=100000 ;
—这个是group的键对应的记录条数超过这个值则会进行分拆,值根据具体数据量设置

set hive.groupby.skewindata=true;
–如果是group by过程出现倾斜应该设置为true

set hive.skewjoin.key=100000;
–这个是join的键对应的记录条数超过这个值则会进行分拆,值根据具体数据量设置

set hive.optimize.skewjoin=true;
–如果是join 过程出现倾斜应该设置为true

并行
hive.exec.parallel参数控制在同一个sql中的不同的job是否可以同时运行,默认为false.
在资源充足的时候hive.exec.parallel会让那些存在并发job的sql运行得更快,但同时消耗更多的资源

qq_34124060

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
hive数据优化

影响Mapper的数量 1）文件数量 2）文件大小，根据下面参数进行切割 set mapred.max.split.size=128000000影响Reducer数量 mapred.reduce.tasks(强制指定reduce的任务数量) hive.exec.reducers.bytes.per.reducer（每个reduce任务处理的数据量，默认为1000^3=1G）...
复制链接

扫一扫

专栏目录