一次Spring Boot假死诊断。。。

最新推荐文章于 2024-08-17 16:33:05 发布

加班不秃顶

最新推荐文章于 2024-08-17 16:33:05 发布

阅读量1.1w

点赞数 2

文章标签： spring boot Java 程序员

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/mifffy_java/article/details/97900888

版权

这两天遇到一个服务假死的问题，具体现象就是服务不再接收任何请求，客户端会抛出Broken Pipe。

01 检查系统状态

执行top，发现CPU和内存占用都不高，但是通过命令

netstat -n | awk '/^tcp/ {++S[$NF]} END {for(a in S) print a, S[a]}'

发现有大量的CLOSEWAIT端口占用，继续调用该服务的api，等待超时之后发现CLOSEWAIT的数量也没有上升，也就是说服务几乎完全僵死。

02 检查JVM情况

怀疑可能是线程有死锁，决定先dump一下线程情况，执行

jstack > /tmp/thread.hump

发现tomcat线程基本也正常，都是parking状态。

这就比较奇怪了，继续想是不是GC导致了STW，使用jstat查看垃圾回收情况

app@server:/tmp$ jstat -gcutil 1 2000 10

S0 S1 E O M CCS YGC YGCT FGC FGCT GCT

0.00 27.79 65.01 15.30 94.75 92.23 1338 44.375 1881 475.064 519.439

一看吓一跳，FGC的次数居然超过了YGC，时长有475s。一定是有什么原因触发了FGC，好在我们打开了GC log。

发现一段时间内频繁发生Allocation Failure引起的Full GC。而且eden区的使用占比也很大，考虑有频繁新建对象逃逸到老年代造成问题。询问了一下业务的开发，确认有一个外部对接API没有分页，查询后可能会产生大量对象。

由于外部API暂时无法联系对方修改，所以为了先解决问题，对原有的MaxNewSize进扩容，从192MB扩容到一倍。经过几天的观察，发现gc基本趋于正常

S0 S1 E O M CCS YGC YGCT FGC FGCT GCT

0.00 3.37 60.55 8.60 95.08 92.98 87 2.421 0 0.000 2.421

扩容之前对heap进行了dump

jmap -dump:format=b,file=heapDump

通过MAT分析内存泄露，居然疑似是jdbc中的一个类，但其实整体占用堆容量并不多。

分析了线程数量，大约是240多条，与正常时也并没有很大的出入。而且大量的是在sleep的定时线程。

03 总结

本次排查其实并未找到真正的原因，间接表象是FGC频繁导致服务假死。而且acturator端口是正常工作的，导致health check进程误认为服务正常，没有触发告警。如果你也遇到类似的情况欢迎一起讨论。

加班不秃顶

关注

2
点赞
踩
15

收藏

觉得还不错? 一键收藏
1
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。