Spark性能调优之 Spark 数据倾斜（五）

最新推荐文章于 2020-12-11 10:42:27 发布

MnerX

最新推荐文章于 2020-12-11 10:42:27 发布

阅读量441

点赞数

分类专栏： Spark 文章标签： Spark Spark调优

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_38483094/article/details/99475295

版权

参考网站：

http://spark.apache.org/docs/latest/configuration.html

http://spark.apache.org/docs/latest/tuning.html

*最终极的办法就是自定义分区器

Spark中的数据倾斜问题主要指shuffle过程中出现的数据倾斜问题，是由于不同的key对应的数据量不同导致的不同task所处理的数据量不同的问题。

例如，reduce点一共要处理100万条数据，第一个和第二个task分别被分配到了1万条数据，计算5分钟内完成，第三个task分配到了98万数据，此时第三个task可能需要10个小时完成，这使得整个Spark作业需要10个小时才能运行完成，这就是数据倾斜所带来的后果。

注意，要区分开数据倾斜与数据量过量这两种情况，数据倾斜是指少数task被分配了绝大多数的数据，因此少数task运行缓慢；数据过量是指所有task被分配的数据量都很大，相差不多，所有task都运行缓慢。

数据倾斜的表现：

1. Spark作业的大部分task都执行迅速，只有有限的几个task执行的非常慢，此时可能出现了数据倾斜，作业可以运行，但是运行得非常慢；

2. Spark作业的大部分task都执行迅速，但是有的task在运行过程中会突然报出OOM，反复执行几次都在某一个task报出OOM错误，此时可能出现了数据倾斜，作业无法正常运行。

定位数据倾斜问题：

1. 查阅代码中的shuffle算子，例如reduceByKey、countByKey、groupByKey、join等算子，根据代码逻辑判断此处是否会出现数据倾斜；

2. 查看Spark作业的log文件，log文件对于错误的记录会精确到代码的某一行，可以根据异常定位到的代码位置来明确错误发生在第几个stage，对应的shuffle算子是哪一个；

解决方案一：聚合原数据

避免shuffle过程·

绝大多数情况下，Spark作业的数据来源都是Hive表，这些Hive表基本都是经过ETL之后的昨天的数据。

为了避免数据倾斜，我们可以考虑避免shuffle过程，如果避免了shuffle过程，那么从根本上就消除了发生数据倾斜问题的可能。

如果Spark作业的数据来源于Hive表，那么可以先在Hive表中对数据进行聚合，例如按照key进行分组，将同一key对应的所有value用一种特殊的格式拼接到一个字符串里去，这样，一个key就只有一条数据了；之后，对一个key的所有value进行处理时，只需要进行map操作即可，无需再进行任何的shuffle操作。通过上述方式就避免了执行shuffle操作，也就不可能会发生任

最低0.47元/天解锁文章

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
Spark性能调优之 Spark 数据倾斜（五）

参考网站：http://spark.apache.org/docs/latest/configuration.htmlhttp://spark.apache.org/docs/latest/tuning.html*最终极的办法就是自定义分区器Spark中的数据倾斜问题主要指shuffle过程中出现的数据倾斜问题，是由于不同的key对应的数据量不同导致的不同task所处理的数据量不同...
复制链接

扫一扫

专栏目录

MnerX CSDN认证博客专家 CSDN认证企业博客

码龄7年

66: 原创

24万+: 周排名

53万+: 总排名

11万+: 访问

: 等级

1751: 积分

38: 粉丝

53: 获赞

38: 评论

249: 收藏

私信

关注

热门文章

分类专栏

最新评论

apache Impala详细安装（躺过最全的坑）
孙行者Monkey: service impala-catalog start报错如下：Clock: clocksource: 'kvm-Error occurred during initialization of VM java/lang/NoClassDefFoundError: java/lang/Object
算法复杂度
CSDN-Ada助手: 非常感谢您分享关于算法复杂度的博客，我觉得您可以进一步深入探讨一下常见算法的时间复杂度和空间复杂度，并结合具体案例进行分析和优化。这样的技术文章对其他用户了解算法复杂度和优化非常有帮助。下一篇您可以继续就优化算法复杂度方面继续写，相信会有更多读者受益。加油！为了方便博主创作，提高生产力，CSDN上线了AI写作助手功能，就在创作编辑器右侧哦～（https://mp.csdn.net/edit?utm_source=blog_comment_recall ）诚邀您来加入测评，到此（https://activity.csdn.net/creatActivity?id=10450&utm_source=blog_comment_recall）发布测评文章即可获得「话题勋章」，同时还有机会拿定制奖牌。
数据挖掘十大经典算法之 KNN算法
OBzzzzz: 大名鼎鼎的鸢尾花
数据挖掘十大经典算法之 KNN算法
笑笑@L: 数据集呢
WIN 10 系统Alt + Tab 切换窗口卡顿问题结局方案
Yicon_: 导入之后想删掉怎么办啊

大家在看

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。