基于Java的微服务架构中Pod OOM Killed重启问题排查求助
微服务Pod OOM Killed重启排查情况
我的微服务运行着2个Pod,二者均因Kubernetes标记的OOM Killed原因重启。
用于监控的查询语句:
sum(0,increase(kube_pod_container_status_last_terminated_reason{cluster="prod_cluster",container=~"$service"}[$__range])) by (reason,container,namespace,pod) > 0
排查步骤及结果:
- 分析Pod的CPU和内存趋势:CPU、内存表现正常,两个Pod的平均CPU和内存消耗均处于正常水平
- 核查服务规格文件:已确认服务资源配置文件内容
- 排查下游依赖连接:与下游服务、数据库、Kafka的连接未发现异常
- 节点内存排查:节点及容器内存消耗始终正常,未出现峰值或泄漏情况
- 流量与延迟分析:流量模式及所有下游系统的延迟均无异常
已排查OOM Killed的所有可能原因,但未得出明确结论,仍预期存在内存溢出情况。
内容的提问来源于stack exchange,提问作者Yash Arora
相关产品推荐
相关产品推荐

