在GCP上配置Databricks集群遇配额超限错误求助
解决GCP Databricks集群因配额超限终止的问题
问题核心
你的Databricks集群创建后立即终止,根源是GCP us-central1区域的两项资源配额超限:
SSD_TOTAL_GB:申请1500GB,限额500GBN2_CPUS:申请12核,限额8核
同时GKE集群因pod阻塞无法缩容,这是配额不足引发的连锁问题。
解决方案
1. 临时调整Databricks集群配置,适配现有配额
- CPU配额适配:
- 减少worker节点数量,或者降低单个worker实例的CPU规格(例如将
n2-standard-4替换为n2-standard-2),确保集群总申请CPU核数不超过8核的限额。 - 若使用自动扩缩容,需调整最大节点数,避免扩容后触发配额限制。
- 减少worker节点数量,或者降低单个worker实例的CPU规格(例如将
- SSD配额适配:
- 在Databricks集群配置的「Instance Details」中,减少每个节点挂载的本地SSD数量,或者降低节点总数,将总SSD申请量控制在500GB以内。
2. 解除GKE集群缩容阻塞
- 执行
kubectl get pods -n <databricks-namespace>查看阻塞缩容的pod详情,确认是否存在以下情况:- pod关联了
PodDisruptionBudget(PDB)限制,导致无法被驱逐 - pod处于异常状态(如
CrashLoopBackOff、Pending)
- pod关联了
- 针对PDB限制,可临时调整PDB的最小可用实例数;针对异常pod,直接删除即可解除缩容阻塞。注意:此操作需在解决配额问题后进行,否则会重复触发错误。
3. 长期解决方案:申请GCP配额提升
若业务确实需要更高资源,可通过GCP控制台申请配额提升:
- 进入「IAM与管理员」→「配额」页面
- 搜索
SSD_TOTAL_GB和N2_CPUS,筛选us-central1区域 - 点击「编辑配额」,填写需要提升的额度及业务需求说明,提交后等待GCP审核通过。
内容的提问来源于stack exchange,提问作者Ammon
相关产品推荐
相关产品推荐

