You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure Databricks作业集群启动失败:驱动异常致ADF管道重试失败

问题分析与解决方案

可能原因

  • 作业集群配置差异:交互式集群正常不代表作业集群配置没问题,比如作业集群使用的实例类型配额耗尽、初始化脚本出错、第三方库依赖冲突,或是自定义镜像存在缺陷导致驱动节点初始化失败。
  • 订阅级资源配额限制:你的订阅在目标区域的特定虚拟机实例配额已用完,而交互式集群使用的是不同型号实例,因此未受影响。
  • 工作区作业集群专属限制:工作区针对作业集群设置了特殊的VNet/NSG规则,阻断了驱动节点与Databricks控制平面的通信;或者作业集群的服务主体权限不足,无法获取必要资源。
  • 区域资源临时供给问题:Azure在该区域对作业集群所用实例的临时供给紧张,不同订阅的资源池隔离导致你的订阅受影响,同事的订阅不受影响。

可自行排查的解决步骤

  1. 核对集群配置差异
    • 对比作业集群与交互式集群的实例类型,在Azure门户「订阅」→「使用情况+配额」中查看对应区域的VM配额是否充足。
    • 检查作业集群的初始化脚本/动作,确认脚本无语法错误、依赖资源可正常访问,可临时禁用初始化脚本测试集群能否启动。
    • 移除作业集群中安装的非必要第三方库,排除库依赖冲突问题。
  2. 检查网络与权限配置
    • 若作业集群部署在VNet内,确认NSG规则允许驱动节点出站访问443、22等必要端口,确保能与Databricks控制平面通信。
    • 验证作业集群使用的服务主体是否拥有虚拟机创建、磁盘挂载等必要权限。
  3. 手动测试作业集群
    • 在Azure Databricks门户手动创建与作业集群配置完全一致的集群,查看「事件日志」获取更详细的启动失败原因(如磁盘挂载失败、权限错误)。
  4. 临时更换实例类型
    • 将作业集群的实例类型替换为交互式集群使用的型号,测试能否正常启动,排除特定实例类型的问题。

若自行排查无效

  • 查看Azure状态页确认目标区域的Databricks服务状态,但因同区域其他订阅正常,大概率不是全局服务中断。
  • 联系Azure技术支持,提供集群ID、ADF管道运行ID及集群启动日志,排查订阅或工作区层面的专属问题。

内容的提问来源于stack exchange,提问作者Minura Punchihewa

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 01:15:35