记一次线上服务假死问题处理

记一次线上服务假死问题处理

记一次线上服务假死问题处理

首先 在服务器上下载arthas
官网
https://arthas.aliyun.com/doc/download.html

下载完成arthas-boot.jar

启动arthas

java -jar  arthas-boot.jar

选择要分析的服务

1.首先我通过

dashboard

命令 观察内存gc情况和内存使用情况
结果 老年代 内存充足(可用4g 已用1g) gc时间也不长 (8次老年代gc 3000ms)
排除内存问题

2.thread命令
查看阻塞其他线程的线程

thread -b 

结果显示没有 (正常)

然后查看所有线程

thread -all 

结果显示有大量进程处于 WAITING 状态

WAITING 状态的线程:
为等待状态 并且不会释放的状态

因为有线程池 有这样的线程也正常 经测试 线程池中等待任务的线程也是这个状态

然后发现其中 有名字开头http-0.0.0.0的WAITING状态的线程
问题就在这

我找了几个线程id
使用

thread 线程id 

查看阻塞线程的堆栈
结果显示卡在redis获取连接池资源
然后我去查看代码里连接池配置 没有配置最大等待时间 默认值为-1 即无限等待下去
果断添加最大等待时间 maxWaitMillis 重启服务 目前服务正常 没有假死现象

  • 1
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
在一个流量高峰期间,我们的网站开始出现了性能问题,特别是Tomcat的worker线程居高不下。这个问题对我们的系统稳定性和用户体验产生了严重影响,因此我们立即进行了排查和解决。 首先,我们使用工具监控了Tomcat的worker线程数,发现在高峰期间线程数增长过快,并且没有下降的趋势。接下来,我们对服务器进行了资源监控,发现CPU和内存的使用率都没有超过正常范围。这表明问题不是由于服务器资源不足导致的。 然后,我们查看了Tomcat的日志文件,发现一些异常错误信息与数据库连接相关。我们怀疑是数据库连接池的问题,因此我们进一步检查了数据库的连接数和连接池的配置。经过对比分析,我们发现数据库连接池的最大连接数被设置得过小,导致在高流量时无法满足请求的需求。我们立即调整了连接池的配置,增加了最大连接数,以应对高峰期的负载。 随后,我们重启了Tomcat,并观察了一段时间。我们发现线程数在高峰期开始时仍然有所增长,但是随着时间的推移开始逐渐下降,最终稳定在一个正常的范围内。这表明我们的排查和解决措施是有效的。 为了进一步确保问题的解决,我们还增加了日志监控和报警机制,以便更及时地发现和解决类似问题。 通过这次经历,我们学到了对于高并发流量情况下的线上问题,需要全面考虑不同组件的性能和配置,并对各个环节进行监控和调整。同时,日志分析和排查是至关重要的工作,能够帮助我们准确定位问题并采取合适的解决措施,最终提升系统的稳定性和性能。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值