You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Rest API部署在线推理模型时如何节省VM成本

ADB推理专属VM闲置自动关停配置方案

支持配置闲置时长阈值自动关停对应VM,完全可以实现测试场景下的成本控制,具体可通过三种方式落地:

  • 单模型部署时直接配置规则
    通过REST API发起模型部署请求时,在请求体中增加auto_shutdown配置段,指定闲置超时时间即可,配置参考如下:
    {
      "model_id": "your_model_version_id",
      "service_name": "test-inference-service",
      "compute": {
        "vm_size": "Standard_D4s_v5"
      },
      "auto_shutdown": {
        "enable": true,
        "idle_time_threshold": 45
      }
    }
    
    其中idle_time_threshold单位为分钟,判定逻辑为对应VM连续指定时长内无任何推理请求、无服务运维操作(如日志拉取、模型热更新、调试连接)时,自动触发关停,停止后不再收取VM计算费用。该配置为服务级独立配置,不同模型可根据测试需求设置不同阈值。
  • 存量已运行服务补配规则
    对于部署时未配置自动关停、当前处于持续运行状态的存量推理服务,无需重新部署,直接调用对应服务的更新接口,传入上述auto_shutdown配置段即可,配置更新过程不会中断正在运行的推理服务,生效后立即开始闲置时长统计。
  • 工作区全局默认规则配置
    若需要避免新服务漏配关停规则,可在ADB工作区的在线推理服务管理板块,设置全局默认的闲置关停阈值,后续所有通过控制台、REST API新建的推理服务,若未单独指定自动关停参数,将默认继承该全局规则,从创建之初就纳入闲置管控。

实操提示:VM触发自动关停后,后续首次收到推理请求时会自动执行冷启动,冷启动耗时根据模型体积、VM规格不同通常在16分钟不等。如果是面向线上业务的生产级低延迟推理服务,不建议设置过短的闲置阈值;日常模型调试、效果测试类场景,设置3060分钟的闲置阈值即可覆盖绝大多数使用需求,同时能减少90%以上的无效资源开销。

内容的提问来源于stack exchange,提问作者John Wilmar Herrera Gil

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.30 15:09:33