如何在OpenAI Eval中配置生产环境工具并自定义评估数据?
关于在OpenAI控制台创建带自有工具的Eval的说明
可以在OpenAI控制台创建与生产环境配置完全一致的自定义Eval,具体操作步骤如下:
- 进入控制台「Evals」板块,点击「Create eval」发起自定义评估创建流程。
- 选择「Custom」作为评估类型,解锁全自定义配置权限。
- 在「Model configuration」区域复刻生产环境设置:
- 指定模型为
gpt-4.1-2025-04-14 - 填入和生产环境完全相同的
systemInstructions - 在「Tools」选项中导入你生产环境使用的工具schema,确保函数名称、参数定义、描述等结构完全匹配
- 指定模型为
- 在「Dataset」部分上传你的自有问题列表(支持JSONL等格式),每条数据需包含
input字段(对应生产请求中的input),可选添加ideal字段用于自动评估参考。 - 根据需求配置评估规则:若需自动评估,可设置基于工具调用正确性的判断逻辑;若需人工评估,后续可手动审核结果。
- 完成配置后启动评估,系统将按照你指定的模型、工具和数据集生成响应,完全匹配生产环境的调用逻辑。
注意:工具schema的格式必须与生产环境完全一致,包括参数类型、必填项、描述文本,这是保障评估有效性的关键。
内容的提问来源于stack exchange,提问作者lando2319
相关产品推荐
相关产品推荐

