AWS Aurora V2集群ACU利用率异常尖峰问题排查求助
AWS Aurora V2 ACU突发尖峰排查方案
排查方向
- 细分监控指标分析
重点查看ACU利用率的细分维度(计算、IO、内存占比),同步对比WriteIOPS/ReadIOPS、BufferCacheHitRatio、TransactionLogsGenerated、ReplicaLag等指标,定位尖峰是由计算、IO还是内存瓶颈触发。尖峰时段只读实例的异常需关注主从同步的IO负载变化。 - 后台内部操作核查
排查CloudTrail中Aurora相关的API调用记录,确认尖峰时段是否存在AWS发起的快照合并、日志归档、自动统计信息收集(ANALYZE)等后台任务;同时检查AWS Health Dashboard,确认是否有区域级基础设施维护事件。 - 隐性外部触发源排查
检查VPC内关联资源(ETL工具、监控探针、第三方备份脚本)的运行日志,确认是否存在周期性的连接或扫描操作;查看安全组流量日志,排查无用户时段的异常IP连接尝试。 - 临时SQL日志抓取
临时开启Postgres参数log_statement = 'all'(注意控制日志留存时长,避免磁盘占满),在尖峰时段捕获执行的SQL语句,定位是否存在租户侧隐性定时任务(如后台数据同步、报表生成)或异常查询。 - 参数组与资源碎片化检查
再次核查参数组中work_mem、maintenance_work_mem等可能引发内存突增的配置,确认autovacuum相关参数无异常;同时查看FreeStorageSpace、StorageThroughput指标,排查存储层碎片化导致的IO突增。 - 实例AZ迁移验证
将读写或只读实例迁移至其他可用区,观察尖峰是否消失,以此判断是否为当前AZ底层主机的硬件波动问题。
是否为Aurora正常现象
这种无规律周期性、非业务触发的ACU尖峰不属于Aurora正常运行范畴。正常自动扩缩容应与业务负载、可预期后台任务强关联,而间隔20-30分钟、持续1-3天又突然消失的模式不符合常规运行逻辑。
是否为服务器端自身问题
存在这种可能性,但需先排除外部触发、内部后台任务的影响。可通过CloudTrail、AWS Health Dashboard排查AWS侧的维护或底层主机异常,结合AZ迁移验证来确认是否为服务器端问题。
内容的提问来源于stack exchange,提问作者omatase
相关产品推荐
相关产品推荐

