GKE Autopilot(NAP节点)上ESPv2 Sidecar间歇性故障求助
GKE Autopilot NAP节点上ESPv2 Sidecar间歇性连接后端失败问题
问题描述
在GKE Autopilot环境中,我们采用ESPv2作为Sidecar与Spring Boot后端容器配合,通过Cloud Endpoints暴露基于OpenAPI定义的API。目前遇到ESPv2 Sidecar容器间歇性故障:该问题仅出现在NAP(Node Auto-Provisioning)节点上,ESPv2频繁无法连接127.0.0.1:8080的后端容器,故障虽为间歇性但发生概率极高,直接导致Pod无法成功启动。
已尝试操作
- 验证后端容器健康状态:后端可正常响应健康检查,日志显示返回
200 OK - 为ESPv2添加
startupProbe以延迟启动 - 将ESPv2入口点包裹在shell脚本中,通过
nc -z 127.0.0.1 8080命令等待后端服务可达后再启动 - 提升后端容器与ESPv2容器的CPU和内存资源分配
故障日志
ESPv2 Sidecar仍频繁记录以下错误:
immediate connect error: Connection refused
环境信息
- 集群类型:GKE Autopilot
- ESPv2镜像:
gcr.io/endpoints-release/endpoints-runtime:2 - 部署模式:每个Pod包含一个Spring Boot后端容器 + 一个ESPv2 Sidecar容器
- 后端配置:Spring Boot服务监听
0.0.0.0:8080
求助方向
该问题在非NAP节点上未出现,推测与Autopilot中NAP节点的特定行为相关,可能涉及节点网络初始化逻辑或容器启动顺序差异。恳请提供针对性指导,尤其是针对GKE Autopilot和NAP节点行为的排查与解决方案建议。
内容的提问来源于stack exchange,提问作者Danny Uribe
相关产品推荐
相关产品推荐

