You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在GCP上配置Databricks集群遇配额超限错误求助

解决GCP Databricks集群因配额超限终止的问题

问题核心

你的Databricks集群创建后立即终止,根源是GCP us-central1区域的两项资源配额超限:

  • SSD_TOTAL_GB:申请1500GB,限额500GB
  • N2_CPUS:申请12核,限额8核
    同时GKE集群因pod阻塞无法缩容,这是配额不足引发的连锁问题。

解决方案

1. 临时调整Databricks集群配置,适配现有配额

  • CPU配额适配:
    • 减少worker节点数量,或者降低单个worker实例的CPU规格(例如将n2-standard-4替换为n2-standard-2),确保集群总申请CPU核数不超过8核的限额。
    • 若使用自动扩缩容,需调整最大节点数,避免扩容后触发配额限制。
  • SSD配额适配:
    • 在Databricks集群配置的「Instance Details」中,减少每个节点挂载的本地SSD数量,或者降低节点总数,将总SSD申请量控制在500GB以内。

2. 解除GKE集群缩容阻塞

  • 执行kubectl get pods -n <databricks-namespace>查看阻塞缩容的pod详情,确认是否存在以下情况:
    • pod关联了PodDisruptionBudget(PDB)限制,导致无法被驱逐
    • pod处于异常状态(如CrashLoopBackOff、Pending)
  • 针对PDB限制,可临时调整PDB的最小可用实例数;针对异常pod,直接删除即可解除缩容阻塞。注意:此操作需在解决配额问题后进行,否则会重复触发错误。

3. 长期解决方案:申请GCP配额提升

若业务确实需要更高资源,可通过GCP控制台申请配额提升:

  1. 进入「IAM与管理员」→「配额」页面
  2. 搜索SSD_TOTAL_GB和N2_CPUS,筛选us-central1区域
  3. 点击「编辑配额」,填写需要提升的额度及业务需求说明,提交后等待GCP审核通过。

内容的提问来源于stack exchange,提问作者Ammon

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.24 12:33:19