You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure Databricks集群启动失败求助:DevOps触发作业报错

Azure Databricks作业多次运行后挂起失败问题排查

问题现象

通过DevOps流水线触发Azure Databricks作业,初始运行正常,但多次运行后作业进入挂起状态并失败。

作业报错信息

run failed with error message
Unexpected failure while waiting for the cluster (1031-182958-d705352n) to be ready: Cluster 1031-182958-d705352n is unusable since the cluster is unhealthy.

事件日志错误

Message
Failed to add 1 container to the compute. Will attempt retry: true. Reason: Cloud provider launch failure

Help
A cloud provider error was encountered while launching worker nodes.

已完成排查

  • 订阅级Standard DSv2 Family vCPUs配额仍有40%可用

作业配置

{
          "name": "'$jobName'",
          "new_cluster": {
            "spark_version": "14.0.x-scala2.12",
            "node_type_id": "Standard_DS3_v2",
            "num_workers": 0
            
          },
          "access_control_list": access_control_list,  
          "notebook_task": {
            "notebook_path": "'$notebookPath'",
            "base_parameters": {
              "env": "$(key)"
            }
          }
}

可能的原因及排查方向

  • 区域级实例配额耗尽:Azure配额分订阅级和区域级,订阅级有剩余不代表目标区域的Standard_DS3_v2实例配额充足,需检查作业所在区域的该实例类型配额。
  • 集群资源残留冲突:多次运行作业创建的单节点集群(num_workers=0)可能存在未彻底清理的残留资源,导致后续集群创建时出现资源调度冲突。可手动清理Databricks中已终止的集群,或改为使用固定现有集群而非每次新建。
  • Azure Compute资源提供商临时限流/故障:Azure底层Compute服务可能存在临时限流或区域级故障,导致无法创建VM实例。可查看Azure门户中Compute资源提供商的状态,或间隔一段时间后重试作业。
  • 集群配置兼容性问题:当前Spark版本(14.0.x)与Standard_DS3_v2实例可能存在兼容性问题,或集群的网络/存储配置异常(如VNet peering失效、存储账户权限不足)。可尝试降级Spark版本(如13.3.x),或检查集群的网络、存储关联配置。
  • 流水线并发调度压力:若流水线短时间内多次触发作业,并发创建集群会给Azure资源调度带来压力,触发限流。可调整流水线的并发策略,增加作业触发间隔。

内容的提问来源于stack exchange,提问作者Vin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.07 05:24:55