GPT-4 Vision预览版OCR增强API调用报400错误求助
解决GPT-4V预览版API调用的400参数错误问题
问题根源
你错误地将检索增强生成(RAG) API的请求参数(enhancements、dataSources)应用到了GPT-4V视觉API请求中,而GPT-4V的视觉接口并不支持这些参数,因此触发了参数验证错误。
正确的GPT-4V视觉API请求结构
调用GPT-4V进行视觉分析(含OCR)时,无需添加enhancements和dataSources字段,只需在请求体的messages中传递图片内容,并通过提示词引导模型执行OCR任务即可。示例请求体如下:
{ "model": "gpt-4-vision-preview", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "请提取这张图片中的所有文字" }, { "type": "image_url", "image_url": { "url": "https://example.com/your-image.jpg" } } ] } ], "max_tokens": 300 }
额外说明
如果需要借助Azure Computer Vision的OCR能力而非GPT-4V内置的OCR,需单独调用Azure Computer Vision的OCR API,将识别结果作为文本输入传递给GPT-4V,而不是通过enhancements参数绑定数据源。
内容的提问来源于stack exchange,提问作者Intelligence6
相关产品推荐
相关产品推荐

