You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

GKE标准集群创建失败(健康检查阶段,进度83%)求解决方案

GKE标准集群创建83%健康检查失败的解决方案
  • 检查VPC和子网配置

    • 确认集群所用子网有足够可用IP,避免节点池IP耗尽
    • 检查VPC防火墙规则,必须允许来自130.211.0.0/22和35.191.0.0/16的TCP流量到节点kubelet端口(默认10250)和容器端口,同时放开ICMP流量用于健康探测
    • 排查是否有自定义网络策略阻断了健康检查节点和集群节点的通信
  • 验证节点池配置

    • 避免使用过旧或不兼容的实例类型,确保节点机器类型符合GKE要求
    • 检查自定义镜像或启动脚本有没有修改kubelet配置,导致健康检查无法正常访问
    • 确认节点服务账号拥有roles/container.nodeServiceAgent权限,保证节点能和控制平面正常通信
  • 查看详细日志定位问题

    • 用gcloud命令查看集群详情:gcloud container clusters describe [CLUSTER_NAME] --zone [ZONE],重点关注statusDetails字段的错误信息
    • 在Cloud Logging中筛选resource.type="gce_instance"和cluster_name="[CLUSTER_NAME]",查找kubelet启动失败、网络配置错误之类的日志
  • 调整健康检查相关参数

    • 如果是自定义节点池,创建集群时添加--node-init-timeout=30m参数,给节点足够时间完成初始化
    • 若启用了私有集群,确认控制平面能正常访问节点,检查主网络和节点网络的路由配置是否正确
  • 清理残留资源后重试

    • 删除失败集群的残留资源:gcloud container clusters delete [CLUSTER_NAME] --zone [ZONE],确保关联的实例、磁盘、防火墙规则都被彻底清理
    • 先用默认配置创建一个最小集群测试,排除自定义配置的问题后,再逐步添加所需配置

内容的提问来源于stack exchange,提问作者dnt-kamal

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.14 13:14:54