使用Terraform部署Azure Databricks集群遇Self-bootstrap启动失败求助
Azure Databricks集群部署出现Self-bootstrap failure的排查解决步骤
检查权限配置
- 确认Terraform使用的服务主体(或管理身份)拥有Databricks工作区的Cluster Creator及以上权限,同时在Azure层面拥有Databricks工作区的Contributor权限
- 手动通过Databricks UI创建集群,验证服务主体是否具备创建集群的能力,排除权限问题
核对集群配置合理性
- 检查集群选用的VM实例类型在目标Azure区域是否可用,避免使用已淘汰或未覆盖的型号
- 确认Spark版本、Databricks Runtime版本与工作区版本兼容,避免跨大版本的不匹配
- 若配置了集群启动脚本,检查脚本是否存在语法错误、依赖缺失或执行超时问题
- 验证集群磁盘配置(本地/附加磁盘)是否在Azure订阅的配额范围内
排查网络与安全规则
- 确认Databricks工作区的VNet配置正确,集群节点可正常访问Databricks控制平面(无公网IP场景需确保VNet peering或服务端点配置生效)
- 检查NSG规则是否允许集群节点向Databricks控制平面发起443端口的出站请求
- 验证子网的私有DNS区域配置,确保节点能正确解析Databricks相关域名
查看详细日志定位根因
- 登录Databricks工作区,在集群页面找到失败集群,查看事件日志获取节点初始化阶段的具体报错细节
- 若启用Azure Monitor集成,在Log Analytics中查询Databricks节点的系统日志,排查节点daemon启动失败的具体原因
重试与环境验证
- 执行
terraform apply重新部署集群,排除临时网络波动或资源调度异常 - 检查Azure订阅的VM数量、CPU核心数等资源配额是否充足,避免因配额不足导致节点无法创建
- 通过Azure门户确认Databricks工作区处于健康状态
- 执行
内容的提问来源于stack exchange,提问作者Akash
相关产品推荐
相关产品推荐

