Databricks SQL Warehouse集群启动失败:RESOURCE_EXHAUSTED错误求助
排查Databricks SQL Warehouse启动失败(RESOURCE_EXHAUSTED)的思路
核对配额的精准性
别只看总配额,要确认你查的是对应SQL Warehouse的资源配额——比如专用Warehouse和Serverless的配额是分开算的,部分区域还会限制单Warehouse的并发集群数、特定节点类型的可用量。另外,检查有没有预留实例占了可用配额,或者当前工作区的细分配额(而非整个账号)已经耗尽。检查集群配置的细节
看看最近有没有改Warehouse的配置:- 是不是换了节点类型?有些节点类型可能当前区域云厂商没库存,哪怕Databricks配额显示有也没用。
- 自动缩放的最大节点数是不是设得太高?超过了工作区单集群的节点数限制。
- 有没有资源策略限制?比如工作区的标签策略或资源规则,限制了这个Warehouse能使用的资源类型/数量。
排查云厂商底层限制
Databricks配额够不代表云厂商那边没问题:- AWS:查EC2实例的区域容量限制,或者VPC的弹性IP、ENI配额是不是用完了。
- Azure:检查对应VM系列的区域可用性,或者虚拟网络的相关资源限制。
- GCP:确认GCE实例的区域配额,以及VPC的资源限制。
查看Databricks内部资源冲突
- 同一工作区里有没有其他正在启动的大集群?可能占了临时调度资源(不是你的配额,是Databricks内部的调度容量)。
- 去Warehouse的事件日志里找细节——在控制台SQL Warehouse页面,点对应Warehouse的「历史记录」或「事件」标签,看有没有
Failed to allocate nodes这类更具体的报错信息。
临时尝试修复
- 先停止Warehouse再启动,别只点重试。
- 临时调小节点数或者换个节点类型试试,能启动的话就说明是配置和资源不匹配的问题。
内容的提问来源于stack exchange,提问作者Jed
相关产品推荐
相关产品推荐

