Azure及AWS平台Databricks集群高可用:可用区故障时VM是否自动跨区故障转移
Databricks集群可用区故障转移规则说明
默认配置下,单可用区部署的Databricks集群遇到整可用区故障时不会自动跨可用区故障转移,需要手动干预,具体逻辑和可选配置如下:
- Spark原生的容错机制仅支持单个VM级别的故障恢复,会在集群内其他存活VM上重调度失败的任务,但无法处理集群所在整个可用区完全不可用的场景。
- 如果你使用的是Databricks Premium层级支持的多可用区(Multi-AZ)集群:
- 集群驱动节点会固定部署在创建时指定的主可用区,工作节点会分散部署在同区域的多个可用区下
- 若故障可用区不是驱动节点所在的可用区,集群会自动在其他存活可用区启动新的工作节点补充算力,失败任务自动重调度,无需手动操作
- 若故障可用区是驱动节点所在的可用区,整个集群会直接终止,需要手动重启集群,新集群会自动选择区域内健康的可用区部署
- 如果你使用的是默认单可用区集群:
- 整可用区故障时集群所有节点都会失联,任务完全终止,必须手动重新创建/启动集群,Databricks会自动将新启动的集群调度到区域内其他正常可用区
- 作业恢复提示:流处理作业如果配置了
checkpoint,手动重启后可以从检查点位置继续处理,不会丢失数据;未配置检查点的批处理作业需要手动重新提交全量任务。
内容的提问来源于stack exchange,提问作者MGomez
相关产品推荐
相关产品推荐

