You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Vertex AI端点未按配置自动扩容,求排查原因

Vertex AI端点未触发自动扩容的可能原因
  • 容器与节点CPU指标混淆:你配置的扩缩容指标aiplatform.googleapis.com/prediction/online/cpu/utilization是容器层面的CPU使用率,而非控制台显示的节点整体CPU使用率。节点60%的使用率可能包含了系统进程、其他服务的消耗,实际预测容器的CPU使用率可能未达到30%的阈值,因此不会触发扩容。
  • 扩缩容冷却周期限制:Vertex AI自动扩缩容存在默认冷却窗口(通常5-10分钟),在冷却期内系统不会重复触发扩缩容操作。如果流量是逐步上升,刚达到阈值的时间未超过冷却周期,系统不会立即扩容。
  • 指标采样与延迟:监控指标从采集到被扩缩容系统识别存在1-5分钟的延迟,且系统需要连续多个采样周期(一般3-5个)检测到指标超过阈值才会触发扩容,20分钟的流量时长可能还未满足持续超阈值的条件。
  • 资源配额不足:检查GCP账号的区域配额,n1-standard-8实例或NVIDIA_TESLA_P100加速器的配额可能已耗尽,导致系统无法创建新的副本实例。
  • 预测服务内部阻塞:如果自定义模型的预测服务存在请求排队、处理阻塞的情况,系统可能判断当前副本仍能应对负载,不会触发扩容。可以检查预测请求的延迟、队列长度等指标进一步确认。

内容的提问来源于stack exchange,提问作者Ryan Stack

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.31 18:32:22