记录一次FLink 背压过大问题处理过程

本文记录了一次Flink作业出现背压过大导致checkpoint超时的问题处理过程。通过查看JobManager日志和JobGraph,发现是由于数据处理速度慢于生成速度引起的。解决方法包括调整算子并发度,通过设置相同并发度形成算子链,以及利用Flink的槽共享优化,有效缓解了背压并使checkpoint时间恢复正常。
摘要由CSDN通过智能技术生成

最近flink job出现了背压的问题, 后果是导致了checkpoint的生成超时, 影响了flink job的运行.

定位问题:

如下图:

1) flink的checkpoint生成超时, 失败:

 

checkpoint超时

2) 查看jobmanager日志,定位问题:

 

jobmanager日志

 

3) 找大神帮忙定位问题, 原来是出现了背压的问题,  缓冲区的数据处理不过来,barrier流动慢,导致checkpoint生成时间长, 出现超时的现象. (checkpoint超时时间设置了30分钟)

下图是背压过高, input 和 output缓冲区都占满的情况

 

buffer缓冲区情况

4) 背压的情况也可以在flink后台的job的JobGraph中查看

 

背压过高

下面说说flink感应反压的过程:</

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值