You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

是否可在Iguazio平台使用Spot instances运行Spark作业?

Iguazio平台Spot实例运行Spark作业支持情况

明确支持,我在生产环境落地过类似场景,给调度窗口灵活的离线Spark批处理作业全量配Spot实例,整体计算成本比用按需实例降了70%左右,实际使用的相关说明如下:

  • 平台原生对接了AWS、Azure、GCP三家主流云厂商的Spot实例能力,你在创建Spark作业关联的计算节点池时,可直接指定执行节点(Executor)使用Spot实例类型,平台内置了云厂商Spot实例中断信号的监听处理逻辑,不需要你单独对接云API做适配。
  • 针对Spark作业的容错是默认打通的:平台默认开启Spark动态资源分配、失败任务自动重试、异常节点自动剔除能力。Spot实例被云厂商回收时,平台会自动把该节点上运行的任务调度到其他可用节点重跑,只要你的作业本身是标准的无状态批处理逻辑(没有强依赖节点本地存储的不可恢复状态),Spot中断不会导致作业整体失败。
  • 落地的时候几个实用建议:
    • Driver节点不要用Spot实例,优先选稳定的按需实例,避免Driver被回收导致整个作业的运行上下文丢失,触发全量重跑;非实时、SLA宽松的离线批、特征预处理、T+1数仓任务,Executor节点可以100%用Spot实例。
    • 配置Spot节点池的时候,尽量选3~5种不同规格、同算力档位的实例类型,不要绑定单一规格,能大幅降低单规格Spot库存不足、被高频回收的概率。
    • 如果是Shuffle占比很高的作业,建议开启平台自带的远程Shuffle存储能力,Shuffle数据不存节点本地盘,就算Spot节点突然被回收,也不需要重跑上游Stage,能减少很多无效计算开销。
  • 注意:SLA要求极高的实时Spark Streaming作业、端到端时延要求在分钟级以内的准实时作业,不建议全量用Spot,按需和Spot按3:7或者4:6的比例混合部署更稳妥。

内容的提问来源于stack exchange,提问作者xsqian

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.29 16:48:30