GKE新增nodepool后持续自动修复无法执行其他集群操作求助
GKE新增节点池后集群持续自动修复问题解决指南
常见原因及对应处理方案
- 配额不足
n1-standard-64实例对应64vCPU、240GB内存,若当前GCP项目对应区域的Compute Engine CPU、内存、持久化磁盘配额不足,节点会创建失败,触发GKE持续自动修复逻辑。
可到GCP控制台「IAM与管理」-「配额」页面,筛选对应区域的相关配额项确认是否超限,超限后提交配额提升申请后重新创建节点池即可。 - 节点健康检查不通过
单节点池的节点启动后,若kubelet、kube-proxy等核心组件启动失败,或节点无法连通集群控制平面,就会触发自动修复。
可先临时禁用节点池的自动修复功能,再登录节点排查具体报错,禁用命令如下:gcloud container node-pools update [节点池名称] --cluster [集群名称] --zone [对应区域] --no-enable-autorepair - 节点镜像兼容性问题
如果使用自定义镜像,或集群版本与节点镜像版本不兼容,也会导致节点启动异常。可以将节点池镜像切换为GKE官方维护的Container-Optimized OS镜像,再重新创建节点池验证。 - 资源预留配置异常
如果手动调整过节点的kube-reserved、system-reserved参数,可能导致大规格节点的系统预留资源不足,kubelet无法正常启动。恢复为GKE默认的资源预留配置即可解决。
紧急恢复方案
如果需要立刻恢复集群操作能力,可直接删除异常节点池,自动修复逻辑会同步终止,之后再逐步排查问题。删除命令如下:gcloud container node-pools delete [节点池名称] --cluster [集群名称] --zone [对应区域]
问题截图参考

内容的提问来源于stack exchange,提问作者Manoj vardhan reddy
相关产品推荐
相关产品推荐

