You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Data Factory控制器管道运行失败时如何自动从失败活动处重跑?

Pipeline失败后从断点自动重跑的可行方案

完全不需要逐个修改500余个Copy Data任务,有两个低成本可落地的方案可选:

方案1:Controller Pipeline原生配置(推荐)

  • 目前主流的流水线编排工具(包括Azure Data Factory、Airflow、Prefect等)均原生支持Pipeline级别的断点续跑能力,你只需要在对应的Controller Pipeline设置中开启失败重试,同时勾选「从失败的活动位置继续执行」即可,该配置对Controller下所有嵌套的子Pipeline、活动任务统一生效,不需要修改任何子级任务的配置。
  • 重试次数、重试间隔可根据你的故障场景自定义,比如设置重试3次、每次间隔5分钟,可覆盖绝大多数临时超时、KeyVault临时访问故障的场景。

方案2:批量配置子任务重试规则

如果你需要针对Copy Data任务单独配置重试逻辑,也不需要逐个手动修改:

  • 导出所有包含Copy Data任务的Pipeline的JSON配置模板,写简单的批量脚本替换所有Copy Data任务的重试规则字段,再批量导回编排系统即可,全程耗时不超过10分钟。

注意事项

  • 配置重跑前需要确认所有写入类任务支持幂等执行,避免重跑产生重复数据、脏数据,可额外增加执行前校验、数据去重逻辑规避重跑副作用。
  • 针对KeyVault访问失败、超时这类高频故障,建议先排查是否存在固定的权限、网络连通性问题,从根源降低故障率比重试配置效率更高。

内容的提问来源于stack exchange,提问作者Tom Brox

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 08:54:03