GCP托管实例组自动修复健康检查持续超时问题求助
问题
我在GCP上配置的托管实例组(managed instance group)健康检查持续超时,导致组管理器判定所有实例始终处于不健康状态。

我猜测是防火墙配置有误,但无法确认或定位具体问题。
注意:我询问的不是负载均衡健康检查,而是用于自动修复(auto-healing)的托管实例组健康检查。
错误信息
在托管实例组的“错误”标签页中,我始终看到以下错误:
WAITING_FOR_HEALTHY_TIMEOUT_EXCEEDED Waiting for HEALTHY state timed out (autohealingPolicy.initialDelay=300 sec) for instance projects/project-402019/zones/us-central1-f/instances/server-20bd and health check projects/project-402019/global/healthChecks/server-health-check.
调试步骤
- 通过SSH登录VM后执行
curl http://127.0.0.1:3001/hello,可成功获取响应(当前运行简单echo服务)。 - 已按照官方文档配置防火墙,允许端口3001的入站流量,详见下方防火墙配置。
- 将初始化周期和自动修复初始延迟设置为5分钟以上(实际30秒后即可SSH登录并成功curl)。
- 将健康检查超时时间设置为30秒(curl请求可立即响应)。
- 已开放防火墙所有端口。
配置信息
防火墙

健康检查
我已尝试多种不同配置:
- TCP与HTTP类型
- 2-30秒范围内的检查间隔/超时时间
- 1-3的健康/不健康阈值

内容的提问来源于stack exchange,提问作者Nick
相关产品推荐
相关产品推荐

