You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Vertex自定义模型训练组件因元数据问题无限重试

解决Vertex AI自定义训练流水线无限重试的ETag不匹配问题

问题概述

在当前项目运行曾在其他项目成功执行的Vertex自定义模型训练流水线,已确认服务账号、存储桶等基础设施配置完全一致,但训练组件陷入无限重试状态。

错误信息

点击组件后,流水线UI灰色框显示以下错误:

Retryable error reported. System is retrying.
com.google.cloud.ai.platform.common.errors.AiPlatformException: code=ABORTED, message=Specified Execution `etag`: `1662555654045` does not match server `etag`: `1662555533339`, cause=null System is retrying.

日志审计关联标签

查看日志审计发现以下关联标签:

protoPayload.methodName="google.cloud.aiplatform.internal.MetadataService.RefreshLineageSubgraph"
protoPayload.resourceName="projects/724306335858/locations/europe-west4/metadataStores/default"

已尝试操作

  • 清空、删除元数据存储
  • 更换其他曾成功运行的流水线
    以上操作均未解决问题。

解决方案

  • 确保区域完全一致:确认流水线涉及的所有资源(元数据存储、训练作业、存储桶、服务账号所属区域)均处于同一区域(如europe-west4),跨区域资源交互易引发ETag同步延迟。
  • 彻底清理流水线运行记录:删除当前流水线的所有未完成及历史运行实例,避免残留的旧ETag数据干扰新作业。
  • 更新Vertex AI SDK:升级google-cloud-aiplatform SDK至最新版本,旧版本可能存在ETag处理逻辑的Bug。
  • 校验服务账号权限:确保流水线使用的服务账号拥有aiplatform.metadataStores.update、aiplatform.executions.update权限,权限缺失会导致ETag同步失败。
  • 临时禁用 lineage 子图刷新:在流水线配置中添加参数,关闭RefreshLineageSubgraph自动触发逻辑,绕过ETag校验环节,待作业正常运行后再恢复该功能。

内容的提问来源于stack exchange,提问作者Jan Zajac

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.20 07:12:42