使用Rest API部署在线推理模型时如何节省VM成本
ADB推理专属VM闲置自动关停配置方案
支持配置闲置时长阈值自动关停对应VM,完全可以实现测试场景下的成本控制,具体可通过三种方式落地:
- 单模型部署时直接配置规则
通过REST API发起模型部署请求时,在请求体中增加auto_shutdown配置段,指定闲置超时时间即可,配置参考如下:
其中{ "model_id": "your_model_version_id", "service_name": "test-inference-service", "compute": { "vm_size": "Standard_D4s_v5" }, "auto_shutdown": { "enable": true, "idle_time_threshold": 45 } }idle_time_threshold单位为分钟,判定逻辑为对应VM连续指定时长内无任何推理请求、无服务运维操作(如日志拉取、模型热更新、调试连接)时,自动触发关停,停止后不再收取VM计算费用。该配置为服务级独立配置,不同模型可根据测试需求设置不同阈值。 - 存量已运行服务补配规则
对于部署时未配置自动关停、当前处于持续运行状态的存量推理服务,无需重新部署,直接调用对应服务的更新接口,传入上述auto_shutdown配置段即可,配置更新过程不会中断正在运行的推理服务,生效后立即开始闲置时长统计。 - 工作区全局默认规则配置
若需要避免新服务漏配关停规则,可在ADB工作区的在线推理服务管理板块,设置全局默认的闲置关停阈值,后续所有通过控制台、REST API新建的推理服务,若未单独指定自动关停参数,将默认继承该全局规则,从创建之初就纳入闲置管控。
实操提示:VM触发自动关停后,后续首次收到推理请求时会自动执行冷启动,冷启动耗时根据模型体积、VM规格不同通常在16分钟不等。如果是面向线上业务的生产级低延迟推理服务,不建议设置过短的闲置阈值;日常模型调试、效果测试类场景,设置3060分钟的闲置阈值即可覆盖绝大多数使用需求,同时能减少90%以上的无效资源开销。
内容的提问来源于stack exchange,提问作者John Wilmar Herrera Gil
相关产品推荐
相关产品推荐

