Databricks平台Jar作业超时限制及流式作业运行可行性咨询
Databricks作业超时限制相关问题解答
- 首先明确不同作业类型的超时规则差异:你看到的8月版本说明中提到的2天执行时长限制,仅针对交互式Notebook会话、以及通过Notebook任务类型提交的作业,不会作用于Jar作业、Spark Submit作业、流式专用作业等其他任务类型。
- Jar作业的超时规则:Databricks平台默认没有给Jar类型的作业设置全局固定超时阈值,只要集群正常运行、作业本身没有出现OOM、任务失败重试次数超过上限、依赖资源缺失等自身故障,就可以持续运行数周甚至更长时间,不会被平台主动终止,完全可以支撑你方需要长期运行的Spark业务需求。
- 长时流式作业的运行注意事项:
- 若运行Structured Streaming类流式作业,优先选择平台的「流式作业任务」类型提交,平台针对这类任务做了专属高可用优化,长期运行稳定性更高
- 不要使用交互式集群运行长时作业,建议选择专用作业集群,避免交互式集群的空闲回收、会话过期策略影响作业运行
- 可以在作业配置的高级参数中设置
maxRetries以及重试间隔参数,作业意外退出时会自动重试拉起,进一步降低业务中断风险 - 如果确实有使用Notebook运行长时任务的需求,可以将逻辑拆分为周期调度的分段任务,单段运行时长控制在2天以内,或者将逻辑打包为Jar包提交,即可规避Notebook任务的时长限制
内容的提问来源于stack exchange,提问作者Triffids
相关产品推荐
相关产品推荐

