hive优化

最新推荐文章于 2023-02-11 18:15:26 发布

笑给别人看

最新推荐文章于 2023-02-11 18:15:26 发布

阅读量722

点赞数

分类专栏： Hive 文章标签： hadoop 优化 hive

本文链接：https://blog.csdn.net/u014548898/article/details/53520913

版权

本文探讨了Hive的性能优化，包括JVM重用、推测执行、数据倾斜处理、各种类型的Join优化，以及SMB Join。重点强调了解决数据倾斜问题、减少Job数和合理设置Task数量的重要性，同时提出了小文件合并和整体优化的策略。

摘要由CSDN通过智能技术生成

长期观察hadoop处理数据的过程，有几个显著的特征:
1.不怕数据多，就怕数据倾斜。
2．对jobs数比较多的作业运行效率相对比较低，比如即使有几百行的表，如果多次关联多次汇总，产生十几个jobs，没半小时是跑不完的。map reduce作业初始化的时间是比较长的。
3.对sum，count来说，不存在数据倾斜问题。
4.对count(distinct xxx),效率较低，数据量一多，准出问题，如果是多count(distinct xxx)效率更低。

优化可以从几个方面着手：
1. 好的模型设计事半功倍。
2. 解决数据倾斜问题。
3. 减少job数。
4. 设置合理的map reduce的task数，能有效提升性能。(比如，10w+级别的计算，用160个reduce，那是相当的浪费，1个足够)。
5. 自己动手写sql解决数据倾斜问题是个不错的选择。set hive.groupby.skewindata=true;这是通用的算法优化，但算法优化总是漠视业务，习惯性提供通用的解决方法。 ETL开发人员更了解业务，更了解数据，所以通过业务逻辑解决倾斜的方法往往更精确，更有效。
6. 对count(distinct)采取漠视的方法，尤其数据大的时候很容易产生倾斜问题，不抱侥幸心理。自己动手，丰衣足食。
7. 对小文件进行合并，是行至有效的提高调度效率的方法，假如我们的作业设置合理的文件数，对云梯的整体调度效率也会产生积极的影响。
8. 优化时把握整体，单个作业最优不如整体最优。

JVM重用

JVM

最低0.47元/天解锁文章

笑给别人看

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
hive优化

长期观察hadoop处理数据的过程，有几个显著的特征: 1.不怕数据多，就怕数据倾斜。 2．对jobs数比较多的作业运行效率相对比较低，比如即使有几百行的表，如果多次关联多次汇总，产生十几个jobs，没半小时是跑不完的。map reduce作业初始化的时间是比较长的。 3.对sum，count来说，不存在数据倾斜问题。 4.对count(distinct xxx),效率较低，数据量一多，准出
复制链接

扫一扫

专栏目录