You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何让Databricks作业等待集群可用而非失败

解决Databricks作业集群等待而非失败的方法

1. 配置作业集群启动重试策略

进入“score-customer”作业的编辑页面,在Cluster配置区域找到「集群启动重试策略」:

  • 设置重试次数(建议5-10次)与重试间隔(如30秒),当集群暂时不可用时,作业会自动等待并重试,直到集群就绪或达到重试上限,避免直接失败。

2. 扩容现有集群的并发能力

若使用的是现有交互式集群,这类集群的并发任务数受资源限制:

  • 增加集群节点数量或升级节点规格,提升整体资源容量,支持更多并发任务。
  • 调整Spark配置参数(如spark.executor.instances、spark.executor.cores),优化集群的并发处理能力。

3. 切换为作业集群(Job Cluster)

作业集群是为作业专属创建的临时集群,Databricks会自动调度资源:

  • 在作业设置中,将集群类型改为「Job Cluster」,配置匹配业务需求的实例规格与数量。
  • 多作业实例运行时,平台会自动分配集群资源,避免因单个集群资源耗尽导致的启动失败。

4. 优化作业提交逻辑(替代手动重复提交)

无需手动提交30次作业,可通过以下方式批量处理日期参数:

  • 修改作业代码,支持接收日期范围参数(如--start_date_range 2024-05-01 2024-05-30),在代码内部遍历日期范围执行处理逻辑。
  • 利用Databricks作业调度功能,创建每日调度任务,自动传入当日日期作为参数,实现自动化批量运行。

报错原文:Unexpected failure while waiting for the cluster (1128-195616-z656sbvv) to be ready.

内容的提问来源于stack exchange,提问作者Average_guy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.10 04:45:29