spark性能优化(一)

性能优化概述:

(随着自己学习,持续更新,让博客见证我的成长之路吧)

spark计算本质基于内存,真正使用过的人,肯定遇到各种各样的性能问题,各种OOM;spark性能瓶颈很多:cpu、网络带宽、或者是内存等
数据量太大,内存放不下所有数据,需要对内存进行优化,比如使用些手段减少内存的消耗;内存容量足够放所有数据,网络传输和通信就会导致性能出现瓶颈……
经常遇到oom、文件丢失、task lost、内存异常各种问题,性能优化可以说是spark使用者必须掌握的,为避免自己成为,只会写spark程序不清楚内核原理,不会调优的spark逗比,默默总结下spark性能优化的主要手段:
1,使用高性能序列化类库
2,优化数据结构
3,对多次使用的RDD进行持久化/Checkpoint
4,使用序列化的持久化级别
5,java虚拟机垃圾回收调优
6,提高并行度
7,广播共享数据
8,数据本地化
9,reduceByKey 和groupByKey的合理使用
10,Shuffle调优
spark最大的优点,其实也是最大的问题--基于内存的计算模型。使用了基于内存的计算模型,导致稳定性不如hadoop。随着spark版本不断的更新,spark的稳定性也有了很大的提升,目前spark已更新到了2.1版本,增加了很多新的功能,很值得去尝试。
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值