You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Vertex AI流水线未使用GPU实例预留资源问题咨询

可能导致Vertex AI未使用Compute Engine GPU预留的原因
  • 区域/可用区不匹配
    Vertex AI流水线作业的运行区域和可用区必须与预留实例完全一致。哪怕机器配置完全匹配,只要作业启动的可用区不在预留覆盖范围内,就无法触发预留资源的使用。请核对预留的可用区设置,确认作业指定(或默认使用)的可用区与预留一致。

  • 实例配置细节不匹配
    除了机器类型、加速器类型和数量,还要检查以下细节是否一致:

    • 预留是否指定了特定CPU平台(如AMD/Intel),而Vertex AI作业默认使用的CPU平台不匹配;
    • 预留的虚拟机架构(x86/ARM)是否和作业容器镜像的架构冲突;
    • 预留的实例系列是否明确为a2系列,无其他自定义配置差异。
  • 未显式配置预留关联
    Vertex AI不会自动关联Compute Engine预留,必须在流水线作业配置中显式声明:
    在workerPoolSpecs里添加reservedInstanceAffinity字段,示例配置如下:

    "workerPoolSpecs": [
      {
        "machineSpec": {
          "machineType": "a2-highgpu-2g",
          "acceleratorType": "NVIDIA_TESLA_A100",
          "acceleratorCount": 2
        },
        "reservedInstanceAffinity": {
          "consumeReservationType": "ANY_RESERVATION",
          "key": "your-reservation-label-key",
          "values": ["your-reservation-label-value"]
        },
        "replicaCount": "1",
        "diskSpec": {
          "bootDiskType": "pd-ssd",
          "bootDiskSizeGb": 100
        },
        "containerSpec": {REDACTED}
      }
    ]
    

    若为共享预留,还需确保Vertex AI服务账号拥有该预留的使用权限(在IAM中为服务账号分配Compute Reservation Admin或Compute Instance Admin角色)。

  • GPU配额限制
    即使预留有空闲,若Vertex AI的区域GPU配额(NVIDIA_TESLA_A100)已耗尽,作业会优先进入配额等待队列,而非使用预留资源。请检查对应区域的GPU配额是否有剩余,不足时需提交配额调整申请。

  • 预留状态或属性限制
    检查预留的状态是否为ACTIVE,同时确认:

    • 若为专属预留,作业所在项目必须与预留所属项目一致;
    • 若预留设置了标签过滤,Vertex AI作业的虚拟机实例需带有匹配的标签(可通过流水线配置添加实例标签)。

内容的提问来源于stack exchange,提问作者Lee D.

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.12 20:47:03