Azure Databricks集群启动失败求助:DevOps触发作业报错
Azure Databricks作业多次运行后挂起失败问题排查
问题现象
通过DevOps流水线触发Azure Databricks作业,初始运行正常,但多次运行后作业进入挂起状态并失败。
作业报错信息
run failed with error message
Unexpected failure while waiting for the cluster (1031-182958-d705352n) to be ready: Cluster 1031-182958-d705352n is unusable since the cluster is unhealthy.
事件日志错误
Message
Failed to add 1 container to the compute. Will attempt retry: true. Reason: Cloud provider launch failureHelp
A cloud provider error was encountered while launching worker nodes.
已完成排查
- 订阅级Standard DSv2 Family vCPUs配额仍有40%可用
作业配置
{ "name": "'$jobName'", "new_cluster": { "spark_version": "14.0.x-scala2.12", "node_type_id": "Standard_DS3_v2", "num_workers": 0 }, "access_control_list": access_control_list, "notebook_task": { "notebook_path": "'$notebookPath'", "base_parameters": { "env": "$(key)" } } }
可能的原因及排查方向
- 区域级实例配额耗尽:Azure配额分订阅级和区域级,订阅级有剩余不代表目标区域的
Standard_DS3_v2实例配额充足,需检查作业所在区域的该实例类型配额。 - 集群资源残留冲突:多次运行作业创建的单节点集群(
num_workers=0)可能存在未彻底清理的残留资源,导致后续集群创建时出现资源调度冲突。可手动清理Databricks中已终止的集群,或改为使用固定现有集群而非每次新建。 - Azure Compute资源提供商临时限流/故障:Azure底层Compute服务可能存在临时限流或区域级故障,导致无法创建VM实例。可查看Azure门户中Compute资源提供商的状态,或间隔一段时间后重试作业。
- 集群配置兼容性问题:当前Spark版本(14.0.x)与
Standard_DS3_v2实例可能存在兼容性问题,或集群的网络/存储配置异常(如VNet peering失效、存储账户权限不足)。可尝试降级Spark版本(如13.3.x),或检查集群的网络、存储关联配置。 - 流水线并发调度压力:若流水线短时间内多次触发作业,并发创建集群会给Azure资源调度带来压力,触发限流。可调整流水线的并发策略,增加作业触发间隔。
内容的提问来源于stack exchange,提问作者Vin
相关产品推荐
相关产品推荐

