You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

AWS RDS db.t3.micro实例CPU超基线时API延迟1-2分钟问题咨询

故障原因
  • 你观测到的CPU使用率为CloudWatch默认分钟级平均指标,实际秒级CPU使用率可能已经瞬时打满100%:db.t3.micro的基线性能为20%,对应仅能持续提供0.4vCPU的稳定算力(2vCPU * 20%),即使CPU积分余额充足,瞬间突增的请求/慢查询会短时间耗尽当前可分配的突发CPU配额,导致后续数据库请求进入排队队列,产生1-2分钟的延迟,直到排队请求处理完成/CPU资源释放后自动恢复。
  • 分钟级CPU积分余额指标存在采集延迟:你看到的余额充足是延迟上报的历史数据,峰值时段实际CPU积分已经被瞬时耗尽,实例被强制限流到基线20%性能,进一步拉长了请求排队处理的时间。
  • 单条高消耗SQL占用全部CPU资源:即使整体CPU使用率仅略超20%,单个无索引的大查询、全表扫描操作会占满单个vCPU核心,导致其他正常查询无法分配到CPU资源,出现延迟。
修复方案
  • 切换实例为T3 Unlimited模式:该模式允许实例在CPU积分余额耗尽后,继续按实际使用量支付少量费用使用超过基线的CPU性能,避免被强制限流到基线性能,适合CPU偶尔突增的场景。
  • 优化数据库查询:开启RDS慢查询日志功能,定位峰值时段执行时间长、扫描行数多的SQL,通过增加索引、拆分大查询、优化业务逻辑的方式降低CPU消耗,从根源减少CPU突增情况。
  • 升级实例规格:如果你的业务常态CPU使用率长期超过15%,建议直接升级到更高规格的突发性能实例(如db.t3.small)或固定性能实例(如db.m5.large),彻底规避CPU积分机制带来的性能波动风险。
  • 调整监控粒度:将CPU使用率、CPU积分余额的CloudWatch监控粒度调整为1秒,精准识别瞬时资源瓶颈,避免分钟级平均指标的误判。
  • 配置提前告警:设置CPU使用率超过15%的提前告警,及时响应异常流量或异常查询问题,避免故障扩散。

内容的提问来源于stack exchange,提问作者PRASANTH BATTULA

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 06:24:05