最近flink job出现了背压的问题, 后果是导致了checkpoint的生成超时, 影响了flink job的运行.
定位问题:
如下图:
1) flink的checkpoint生成超时, 失败:
checkpoint超时
2) 查看jobmanager日志,定位问题:
jobmanager日志
3) 找大神帮忙定位问题, 原来是出现了背压的问题, 缓冲区的数据处理不过来,barrier流动慢,导致checkpoint生成时间长, 出现超时的现象. (checkpoint超时时间设置了30分钟)
下图是背压过高, input 和 output缓冲区都占满的情况
buffer缓冲区情况
4) 背压的情况也可以在flink后台的job的JobGraph中查看
背压过高
下面说说flink感应反压的过程:</