AWS RDS Aurora PostgreSQL实例OOM重启问题求助
AWS RDS Aurora PostgreSQL 实例OOM反复重启问题求助
问题现象
AWS RDS Aurora PostgreSQL实例在可用内存接近耗尽时,会因OOM错误崩溃并触发自动重启;重启后可用内存恢复至约16500MB,但随着时间推移内存再次被耗尽,形成重复重启的循环。
环境信息
- 空闲连接数:约450个
- 实例规格:db.r6g.2xlarge
- vCPU:8核
- 内存:64GB
- 引擎版本:11.9
- 连接架构:无连接池实现,由100个应用实例直接建立长连接并复用
数据库配置参数
shared_buffers = 43926128kB work_mem = 4MB temp_buffers = 8MB wal_buffers = 16MB max_connections = 5000 maintenance_work_mem = 1042MB autovacuum_work_mem = -1
异常观察
部分空闲连接对应的进程物理内存(RES,即进程占用的物理内存)持续增长,例如某进程内存从920.9MB逐步增至3.96GiB。怀疑该问题与空闲连接的内存占用相关,考虑通过减少连接数缓解,但希望明确问题根因及系统性解决方法。
附监控截图
- CloudWatch可用内存图表
- CloudWatch通用指标图表
- 增强监控指标图表
- 操作系统进程图表
内容的提问来源于stack exchange,提问作者Thiago Scodeler
相关产品推荐
相关产品推荐

