Vertex自定义模型训练组件因元数据问题无限重试
解决Vertex AI自定义训练流水线无限重试的ETag不匹配问题
问题概述
在当前项目运行曾在其他项目成功执行的Vertex自定义模型训练流水线,已确认服务账号、存储桶等基础设施配置完全一致,但训练组件陷入无限重试状态。
错误信息
点击组件后,流水线UI灰色框显示以下错误:
Retryable error reported. System is retrying. com.google.cloud.ai.platform.common.errors.AiPlatformException: code=ABORTED, message=Specified Execution `etag`: `1662555654045` does not match server `etag`: `1662555533339`, cause=null System is retrying.
日志审计关联标签
查看日志审计发现以下关联标签:
protoPayload.methodName="google.cloud.aiplatform.internal.MetadataService.RefreshLineageSubgraph" protoPayload.resourceName="projects/724306335858/locations/europe-west4/metadataStores/default"
已尝试操作
- 清空、删除元数据存储
- 更换其他曾成功运行的流水线
以上操作均未解决问题。
解决方案
- 确保区域完全一致:确认流水线涉及的所有资源(元数据存储、训练作业、存储桶、服务账号所属区域)均处于同一区域(如
europe-west4),跨区域资源交互易引发ETag同步延迟。 - 彻底清理流水线运行记录:删除当前流水线的所有未完成及历史运行实例,避免残留的旧ETag数据干扰新作业。
- 更新Vertex AI SDK:升级
google-cloud-aiplatformSDK至最新版本,旧版本可能存在ETag处理逻辑的Bug。 - 校验服务账号权限:确保流水线使用的服务账号拥有
aiplatform.metadataStores.update、aiplatform.executions.update权限,权限缺失会导致ETag同步失败。 - 临时禁用 lineage 子图刷新:在流水线配置中添加参数,关闭
RefreshLineageSubgraph自动触发逻辑,绕过ETag校验环节,待作业正常运行后再恢复该功能。
内容的提问来源于stack exchange,提问作者Jan Zajac
相关产品推荐
相关产品推荐

