You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在OpenAI Eval中配置生产环境工具并自定义评估数据?

关于在OpenAI控制台创建带自有工具的Eval的说明

可以在OpenAI控制台创建与生产环境配置完全一致的自定义Eval,具体操作步骤如下:

  • 进入控制台「Evals」板块,点击「Create eval」发起自定义评估创建流程。
  • 选择「Custom」作为评估类型,解锁全自定义配置权限。
  • 在「Model configuration」区域复刻生产环境设置:
    • 指定模型为gpt-4.1-2025-04-14
    • 填入和生产环境完全相同的systemInstructions
    • 在「Tools」选项中导入你生产环境使用的工具schema,确保函数名称、参数定义、描述等结构完全匹配
  • 在「Dataset」部分上传你的自有问题列表(支持JSONL等格式),每条数据需包含input字段(对应生产请求中的input),可选添加ideal字段用于自动评估参考。
  • 根据需求配置评估规则:若需自动评估,可设置基于工具调用正确性的判断逻辑;若需人工评估,后续可手动审核结果。
  • 完成配置后启动评估,系统将按照你指定的模型、工具和数据集生成响应,完全匹配生产环境的调用逻辑。

注意:工具schema的格式必须与生产环境完全一致,包括参数类型、必填项、描述文本,这是保障评估有效性的关键。

内容的提问来源于stack exchange,提问作者lando2319

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.13 02:10:54