Vertex AI endpoints 调用返回502错误 如何修改超时阈值配置
Vertex AI Endpoints 超时调整方案
你遇到的502错误是Vertex AI在线预测端点的默认超时限制导致的,默认请求超时阈值为60秒,超过该时长就会返回502错误,该参数最长可配置为3600秒(1小时),可通过以下方式调整:
1. 控制台可视化调整
进入Vertex AI的「端点」页面,点击对应端点进入详情页,找到目标已部署模型的操作菜单,选择「编辑部署」,在「高级设置」分类下找到「预测请求超时」项,修改为你需要的时长后保存即可。
2. gcloud命令行调整
新部署模型时配置
部署模型到端点时直接指定超时参数,示例为设置3分钟(180秒)超时:
gcloud ai endpoints deploy-model YOUR_ENDPOINT_ID \ --model=YOUR_MODEL_ID \ --machine-type=n1-standard-4 \ --prediction-request-timeout=180s
已有部署模型更新配置
首先查询端点下已部署模型的ID:
gcloud ai endpoints describe YOUR_ENDPOINT_ID
拿到部署模型ID后执行更新命令,示例为调整为180秒超时:
gcloud ai endpoints deployed-models update YOUR_DEPLOYED_MODEL_ID \ --endpoint=YOUR_ENDPOINT_ID \ --prediction-request-timeout=180s
3. Python SDK调整
部署模型时指定prediction_request_timeout参数,单位为秒:
from google.cloud import aiplatform aiplatform.init(project="你的项目ID", location="部署区域") endpoint = aiplatform.Endpoint("你的端点ID") model = aiplatform.Model("你的模型ID") endpoint.deploy( model=model, machine_type="n1-standard-4", prediction_request_timeout=180 )
注意事项
需要同步调整调用端点的客户端超时配置,将客户端超时设置为略大于服务端的超时值,避免客户端先于服务端断开连接。以Python requests调用为例:
import requests response = requests.post( url="端点调用地址", json=请求载荷, headers=认证头, timeout=200 )
内容的提问来源于stack exchange,提问作者user297904
相关产品推荐
相关产品推荐

