使用Terraform创建GKE集群卡在Deploying部署阶段求助
碰到这种部署卡住不动的情况真的很头疼,我整理了几个常见的排查方向,你可以逐一试试:
检查谷歌云的配额与区域状态
首先看看是不是当前区域的资源配额不够了——比如GKE集群需要的CPU、内存配额已经用完。你可以登录谷歌云控制台,找到「IAM与管理」->「配额」页面,搜索和Kubernetes Engine相关的配额项(比如“Kubernetes Engine API 请求数”或者节点实例的CPU配额),看看有没有达到上限。另外也可以去谷歌云的状态页面,确认你部署集群的区域是不是有GKE服务的临时故障。核对Terraform基础配置的细节
哪怕是基础配置,也可能有隐性问题:比如你指定的机器类型在当前区域不支持,或者默认使用的VPC子网IP地址不够用。可以打开你的Terraform配置文件,检查google_container_cluster块里的参数,比如location是不是正确的区域,node_config里的machine_type是不是该区域支持的类型(比如大部分区域都支持e2-medium);另外如果用了自定义VPC,要确认子网的IP范围足够容纳节点数量。开启Terraform debug日志排查具体卡点
你可以重新执行部署命令时加上debug日志参数:TF_LOG=DEBUG terraform apply这样能看到Terraform和谷歌云API交互的详细日志,能明确知道是卡在控制平面创建,还是节点池初始化,或者是其他步骤,这会帮你精准定位问题。
尝试销毁后重新部署
有时候只是偶发的网络波动或者谷歌云侧的临时异常,你可以先尝试销毁当前卡住的资源:terraform destroy等销毁完成后,再重新执行
terraform apply,说不定就能正常完成部署了。
关于你问的是不是谷歌当前的问题,确实有这个可能性,但建议先从上面的排查步骤入手,先排除自身配置和配额的问题,再考虑云服务商侧的故障~
备注:内容来源于stack exchange,提问作者Hugo Maitre

