Vertex AI Pipeline在新GCP项目执行失败:错误代码13求助
Vertex AI Pipeline 一直Pending最终报错的排查方案
问题概述
Pipeline创建成功(提示PipelineJob created. Resource name: XXX),但始终处于PipelineState.PIPELINE_STATE_PENDING状态,最终抛出内部错误:
Traceback (most recent call last): File "/src/pipelines/build_model/pipeline_run.py", line 288, in <module> cli() File "/opt/pysetup/.venv/lib/python3.9/site-packages/click/core.py", line 1130, in __call__ return self.main(*args, **kwargs) File "/opt/pysetup/.venv/lib/python3.9/site-packages/click/core.py", line 1055, in main rv = self.invoke(ctx) File "/opt/pysetup/.venv/lib/python3.9/site-packages/click/core.py", line 1404, in invoke return ctx.invoke(self.callback, **ctx.params) File "/opt/pysetup/.venv/lib/python3.9/site-packages/click/core.py", line 760, in invoke return __callback(*args, **kwargs) File "/src/pipelines/build_model/pipeline_run.py", line 284, in cli job.run() File "/opt/pysetup/.venv/lib/python3.9/site-packages/google/cloud/aiplatform/pipeline_jobs.py", line 314, in run self._run( File "/opt/pysetup/.venv/lib/python3.9/site-packages/google/cloud/aiplatform/base.py", line 810, in wrapper return method(*args, **kwargs) File "/opt/pysetup/.venv/lib/python3.9/site-packages/google/cloud/aiplatform/pipeline_jobs.py", line 351, in _run self._block_until_complete() File "/opt/pysetup/.venv/lib/python3.9/site-packages/google/cloud/aiplatform/pipeline_jobs.py", line 499, in _block_until_complete raise RuntimeError("Job failed with:\n%s" % self._gca_resource.error) RuntimeError: Job failed with: code: 13 message: "遇到内部错误,请重试"
该Pipeline在dev项目可正常运行,新项目已同步配置(API启用、服务账号权限、区域),仅修改项目ID和凭证,更换区域、运行Hello World Pipeline均无效,Cloud Logging无有效信息。
排查解决思路
服务账号权限深度校验
- 确认服务账号拥有
aiplatform.jobs.create、aiplatform.pipelines.run权限,同时检查是否遗漏storage.objects.get、storage.objects.list(若Pipeline依赖GCS存储的组件/数据)。 - 验证服务账号是否绑定了Vertex AI Service Agent角色(
roles/aiplatform.serviceAgent),该角色是Pipeline运行的基础必要权限,容易被忽略。 - 用
gcloud auth activate-service-account激活凭证,手动执行gcloud ai pipeline-jobs describe <job-name>,看是否能正常获取Job信息,排查凭证有效性。
- 确认服务账号拥有
项目级配置检查
- 确认项目已启用全部依赖API:除
aiplatform.googleapis.com外,还需cloudbuild.googleapis.com(构建组件镜像)、container.googleapis.com(K8s相关)、storage.googleapis.com,可通过gcloud services list --enabled核对。 - 检查项目是否有配额限制:即使更换区域,部分全局配额(如Pipeline Job总数)可能触发限制,在GCP控制台的IAM与管理->配额页面,筛选Vertex AI相关配额查看是否有超限。
- 验证项目的网络配置:若使用VPC,需确认是否允许Vertex AI访问外部资源,或者是否配置了私有服务访问(Private Service Access),确保Pipeline组件能正常拉取镜像或依赖资源。
- 确认项目已启用全部依赖API:除
Pipeline基础配置排查
- 检查Hello World Pipeline的定义是否正确,确保没有硬编码dev项目的资源路径(如GCS bucket名称、镜像地址),全部替换为新项目的对应资源。
- 尝试通过GCP控制台手动创建并运行Pipeline,而非代码调用,排查是否是代码中凭证传递或参数配置的问题。
- 查看Vertex AI控制台的Pipeline Job详情页,切换到“日志”标签,展开所有层级日志(包括系统级日志),可能找到比Cloud Logging更详细的错误线索。
GCP内部状态验证
- 检查对应区域的Vertex AI服务状态,确认是否有服务中断或延迟。
- 若以上均无效,可提交GCP支持工单,提供Job资源名称、项目ID、区域信息,让官方排查内部服务异常。
内容的提问来源于stack exchange,提问作者L.GAYET
相关产品推荐
相关产品推荐

