调优VertexAI语言模型时遭遇INTERNAL ERROR OCCURRED 500错误
Vertex AI 大模型调优返回500内部错误排查方案
问题概述
尝试调优Vertex AI的text-bison@001模型时,控制台点击「Start Tuning」后加载1秒即停止,API调用返回Internal error encountered(500错误),已执行官方排查命令但问题未解决。
具体排查步骤
1. 修正区域配置不一致问题
当前API请求存在区域不匹配:
- 请求端点是
europe-west4-aiplatform.googleapis.com(欧洲西部4区) - 参数中
location设为us-central1(美中1区) - 模板URI使用的是美国区域的
us-kfp.pkg.dev
解决方式:统一区域配置,比如都使用us-central1:
- 将请求端点改为
https://us-central1-aiplatform.googleapis.com/v1/projects/${PROJECT_ID}/locations/us-central1/pipelineJobs?... - 确保
dataset_uri的GCS桶、gcsOutputDirectory的GCS桶都在us-central1区域
2. 修复JSON请求语法错误
你的curl命令末尾缺少闭合的},导致JSON格式不完整,服务器解析失败。完整的请求体末尾需要补充:
} }'
修正后的完整curl命令示例:
PROJECT_ID="your-project-id" DATASET_URI="gs://your-bucket/dataset.jsonl" OUTPUT_DIR="gs://your-bucket/output" curl \ -X POST \ -H "Authorization: Bearer $(gcloud auth print-access-token)" \ -H "Content-Type: application/json; charset=utf-8" \ "https://us-central1-aiplatform.googleapis.com/v1/projects/${PROJECT_ID}/locations/us-central1/pipelineJobs?pipelineJobId=tune-large-model-$(date +%Y%m%d%H%M%S)" -d \ $'{ "displayName": "DisplayName", "runtimeConfig": { "gcsOutputDirectory": "'${OUTPUT_DIR}'", "parameterValues": { "project": "'${PROJECT_ID}'", "model_display_name": "ModelName", "dataset_uri": "'${DATASET_URI}'", "location": "us-central1", "large_model_reference": "text-bison@001", "train_steps": 500 } }, "templateUri": "https://us-kfp.pkg.dev/ml-pipeline/large-language-model-pipelines/tune-large-model/v1.0.0" }'
3. 验证数据集格式与权限
- 确保数据集是JSONL格式,每条数据包含
text_input和text_output字段,示例:{"text_input": "用户问题1", "text_output": "回答1"} {"text_input": "用户问题2", "text_output": "回答2"} - 检查数据集所在GCS桶的权限:确保Vertex AI服务账号(格式为
service-${PROJECT_NUMBER}@gcp-sa-aiplatform.iam.gserviceaccount.com)拥有storage.objectViewer角色 - 数据集桶需与项目调优区域一致
4. 检查GCS输出目录配置
- 输出目录所在GCS桶需与调优区域一致
- 确保Vertex AI服务账号拥有
storage.objectCreator角色,能写入该目录 - 目录路径避免特殊字符(如空格、中文)
5. 确认项目配额
- 进入Google Cloud控制台的「IAM与管理」→「配额」页面
- 搜索
Vertex AI Large Model Fine-Tuning相关配额,确认目标区域的配额未耗尽 - 若配额不足,提交配额申请
6. 查看详细错误日志
- 进入Cloud Logging控制台,选择项目后,使用以下过滤器搜索日志:
resource.type="aiplatform_pipeline_job" severity=ERROR - 查看日志中的具体错误信息,比如权限不足、资源缺失、数据集格式错误等,这些信息能直接定位问题
内容的提问来源于stack exchange,提问作者Kayden Humphries
相关产品推荐
相关产品推荐

