Datadog APM追踪中Redis GET等简单操作出现异常耗时的排查求助
Datadog APM追踪中Redis GET等简单操作出现异常耗时的排查求助
各位好,想请教下排查思路:我们团队把Python Django应用部署在AWS EKS的EC2实例上,用Gunicorn做Web服务器,之前试过Apache+wsgi组合,也碰到了一模一样的问题。EC2实例是m6a.xlarge规格,容器的资源限制是1500m CPU、2048MB内存。
我们用Datadog APM做链路追踪,最近偶尔会出现慢请求,深挖Trace后发现简单的Redis GET查询居然要耗时2.8秒!我用Redis好多年了,它向来快得离谱,而且我们平台的负载极低——哪怕是小规格实例CPU也就2%左右,EC2整机的CPU使用率最高也就10%,内存占用也一直处于低位。
我已经在ElastiCache里开启了慢日志,但完全没有抓到相关记录,所以可以确定不是Redis实例本身的问题。现在我有点摸不着头脑:
- 我知道Datadog APM的计时是基于
ddtrace自身在Python代码里的打点逻辑,会不会是我们的Python进程被什么情况阻塞了? - 资源分配方面也没有超配的情况,这部分应该可以排除。
有没有大佬遇到过类似的情况?求指点下排查方向!
内容来源于stack exchange
相关产品推荐
相关产品推荐

