Azure Databricks作业集群启动失败:驱动异常致ADF管道重试失败
问题分析与解决方案
可能原因
- 作业集群配置差异:交互式集群正常不代表作业集群配置没问题,比如作业集群使用的实例类型配额耗尽、初始化脚本出错、第三方库依赖冲突,或是自定义镜像存在缺陷导致驱动节点初始化失败。
- 订阅级资源配额限制:你的订阅在目标区域的特定虚拟机实例配额已用完,而交互式集群使用的是不同型号实例,因此未受影响。
- 工作区作业集群专属限制:工作区针对作业集群设置了特殊的VNet/NSG规则,阻断了驱动节点与Databricks控制平面的通信;或者作业集群的服务主体权限不足,无法获取必要资源。
- 区域资源临时供给问题:Azure在该区域对作业集群所用实例的临时供给紧张,不同订阅的资源池隔离导致你的订阅受影响,同事的订阅不受影响。
可自行排查的解决步骤
- 核对集群配置差异
- 对比作业集群与交互式集群的实例类型,在Azure门户「订阅」→「使用情况+配额」中查看对应区域的VM配额是否充足。
- 检查作业集群的初始化脚本/动作,确认脚本无语法错误、依赖资源可正常访问,可临时禁用初始化脚本测试集群能否启动。
- 移除作业集群中安装的非必要第三方库,排除库依赖冲突问题。
- 检查网络与权限配置
- 若作业集群部署在VNet内,确认NSG规则允许驱动节点出站访问443、22等必要端口,确保能与Databricks控制平面通信。
- 验证作业集群使用的服务主体是否拥有虚拟机创建、磁盘挂载等必要权限。
- 手动测试作业集群
- 在Azure Databricks门户手动创建与作业集群配置完全一致的集群,查看「事件日志」获取更详细的启动失败原因(如磁盘挂载失败、权限错误)。
- 临时更换实例类型
- 将作业集群的实例类型替换为交互式集群使用的型号,测试能否正常启动,排除特定实例类型的问题。
若自行排查无效
- 查看Azure状态页确认目标区域的Databricks服务状态,但因同区域其他订阅正常,大概率不是全局服务中断。
- 联系Azure技术支持,提供集群ID、ADF管道运行ID及集群启动日志,排查订阅或工作区层面的专属问题。
内容的提问来源于stack exchange,提问作者Minura Punchihewa
相关产品推荐
相关产品推荐

