Vertex AI预测服务Autoscaling无法将最小节点设为0相关问题咨询
问题1解答
当你设置自动扩缩容最小节点为1、最大为10时,无流量时段会始终保留1个节点运行,不会缩容到0,你自己的测试结果完全符合产品规则。
官方文档提到的「无流量时段可缩容至0节点」,对应的是Vertex AI的无服务器预测模式,和你当前创建的专用端点属于不同的部署类型。专用端点的自动扩缩容规则本身就限制最小节点数不能低于1,只要你设置的最小值≥1,无论有没有流量都会保留对应数量的节点持续运行,和控制台标注的说明完全一致,不存在规则冲突。
问题2解答
首先你当前使用的专用端点本身不支持缩容至0,只有无服务器预测模式支持该配置。
对于低延迟要求的场景,缩容至0的配置完全不实用。无服务器模式从0节点启动的冷启动延迟没有统一标准:普通小体积CPU模型冷启动耗时在数秒到数十秒区间,如果你使用大模型、GPU/TPU资源,冷启动耗时可能达到数分钟,大概率无法满足低延迟场景的要求。这类场景更适合用专用端点配置≥1的最小节点数,保留常驻资源避免冷启动。
内容的提问来源于stack exchange,提问作者racerX
相关产品推荐
相关产品推荐

