升级EKS节点组从1.17到1.18报AsgInstanceLaunchFailures错误如何解决
EKS 1.18节点组升级失败排查方案
目标组相关报错排查
- 登录EC2控制台定位到对应节点组关联的ASG,进入负载均衡标签页,逐一校验所有绑定的目标组状态:
- 确认所有目标组均处于
active状态,未被误删除、未跨区域/跨VPC绑定 - 解绑所有已经不存在、或不属于当前集群VPC的残留目标组
- 确认所有目标组均处于
- 检查EKS节点组关联的IAM角色权限,确认已添加
elasticloadbalancing:DescribeTargetGroups、elasticloadbalancing:RegisterTargets两类必要操作的允许策略
若目标组是Kubernetes LoadBalancer类型Service自动创建的资源,先到集群内确认对应Service是否存在,已删除的Service对应的残留目标组可直接解绑清理
节点无法加入集群报错排查
- 到EC2控制台查看ASG启动失败的节点实例日志,逐一校验以下配置:
- 升级使用的节点AMI为EKS 1.18对应官方版本,AMI ID与已升级成功的节点组保持一致
- 节点所在子网的安全组入站规则允许EKS控制平面访问443、10250端口,出站规则允许访问控制平面的API Server端点
- 节点关联的IAM角色已绑定
AmazonEKSWorkerNodePolicy、AmazonEC2ContainerRegistryReadOnly官方托管策略 - VPC内DNS解析功能正常,节点可正常解析EKS API Server域名
升级重试操作
- 所有配置修正完成后,先终止当前处于失败状态的节点组升级任务,重新触发版本升级即可
- 若重试依然失败,可先手动将ASG的期望实例数、最小实例数调整为0,待所有旧节点销毁后再触发升级,排除旧配置残留干扰
内容的提问来源于stack exchange,提问作者JuliaS
相关产品推荐
相关产品推荐

