You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Vertex AI endpoints 调用返回502错误 如何修改超时阈值配置

Vertex AI Endpoints 超时调整方案

你遇到的502错误是Vertex AI在线预测端点的默认超时限制导致的,默认请求超时阈值为60秒,超过该时长就会返回502错误,该参数最长可配置为3600秒(1小时),可通过以下方式调整:

1. 控制台可视化调整

进入Vertex AI的「端点」页面,点击对应端点进入详情页,找到目标已部署模型的操作菜单,选择「编辑部署」,在「高级设置」分类下找到「预测请求超时」项,修改为你需要的时长后保存即可。

2. gcloud命令行调整

新部署模型时配置

部署模型到端点时直接指定超时参数,示例为设置3分钟(180秒)超时:

gcloud ai endpoints deploy-model YOUR_ENDPOINT_ID \
  --model=YOUR_MODEL_ID \
  --machine-type=n1-standard-4 \
  --prediction-request-timeout=180s

已有部署模型更新配置

首先查询端点下已部署模型的ID:

gcloud ai endpoints describe YOUR_ENDPOINT_ID

拿到部署模型ID后执行更新命令,示例为调整为180秒超时:

gcloud ai endpoints deployed-models update YOUR_DEPLOYED_MODEL_ID \
  --endpoint=YOUR_ENDPOINT_ID \
  --prediction-request-timeout=180s

3. Python SDK调整

部署模型时指定prediction_request_timeout参数,单位为秒:

from google.cloud import aiplatform

aiplatform.init(project="你的项目ID", location="部署区域")

endpoint = aiplatform.Endpoint("你的端点ID")
model = aiplatform.Model("你的模型ID")

endpoint.deploy(
    model=model,
    machine_type="n1-standard-4",
    prediction_request_timeout=180
)

注意事项

需要同步调整调用端点的客户端超时配置,将客户端超时设置为略大于服务端的超时值,避免客户端先于服务端断开连接。以Python requests调用为例:

import requests

response = requests.post(
    url="端点调用地址",
    json=请求载荷,
    headers=认证头,
    timeout=200
)

内容的提问来源于stack exchange,提问作者user297904

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.30 08:15:03