You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

HiAgent意图识别:训练数据标注操作全流程指南

[1] 一句话结论

本指南将带你完成HiAgent意图识别训练数据的全流程标注操作,保障标注准确率达标。

[2] 适用场景与不适用场景

适用场景

  1. 针对HiAgent搭建垂直领域对话机器人,需要自定义意图识别模型的场景,要求单意图标注量≥500条;
  2. 现有HiAgent意图识别准确率低于85%,需要补充训练数据优化效果的场景;
  3. 上线前做冷启动标注,预期日均对话请求量在1000次以上的业务场景。

不适用场景

  1. 不需要自定义意图,直接使用HiAgent内置通用意图库的场景,建议直接调用内置API即可,无需额外标注;
  2. 单意图标注样本量少于50条的场景,建议用HiAgent少样本学习功能替代全量标注,节省人力成本;
  3. 标注数据无明确业务边界,意图分类模糊的场景,建议先完成意图体系梳理再启动标注工作。

[3] 前置准备

  • 开发环境:火山引擎控制台账号,Chrome 100+浏览器,无需额外本地开发环境;
  • 账号权限:HiAgent FullAccess权限,或者数据标注模块的编辑权限,需主账号提前授权;
  • 依赖项:提前梳理好明确的意图分类体系,每个意图的定义、边界、相似意图区分规则文档;
  • 预计耗时:1000条标注量约2人天完成,含质检环节。

[4] 分步实现

步骤1:导入待标注语料

步骤说明:首先要把收集到的用户真实query、构造的相似query导入标注平台,避免标注内容偏离实际用户需求,跳过这步直接手动输入容易出现样本分布不均的问题,直接影响后续模型训练效果。
操作流程:进入HiAgent控制台→意图识别模块→数据集管理→点击「导入数据集」,选择本地CSV文件,格式要求第一列为query内容,第二列可选为预标注意图。
预期结果:导入成功后数据集列表显示导入的语料数量,状态更新为「待标注」。

⚠️ 常见错误:导入CSV文件时报「格式错误」无法上传
原因:CSV文件存在空行、query内容包含未转义的特殊字符(如逗号、换行符),或者文件编码不是UTF-8
解决方法:先对CSV文件做格式校验,删除空行,对特殊字符进行转义,保存时选择UTF-8编码再重新导入。

步骤2:配置标注规则

步骤说明:给每个标注人员明确意图的定义、边界、拒识规则,以及相似意图的区分标准,保障不同标注人员的标注一致性,跳过这步会导致标注一致性低于70%,模型训练效果大打折扣。
操作流程:进入标注任务配置页,上传提前梳理好的《意图标注规范文档》,设置标注人员角色,每个语料设置2人交叉标注,标注分歧阈值设为0.8,低于阈值的自动进入质检环节。
预期结果:标注任务启动后,标注人员打开任务可以直接查看规范要求,系统自动分配标注任务。

步骤3:执行标注操作

步骤说明:标注人员对每条query选择对应的意图,无法分类的标记为「其他/拒识」,遇到模糊的query直接提交到质检池,不要强行标注,避免引入错误标注样本。
操作流程:在标注工作台打开分配的任务,每条query下拉选择对应意图,确认无误后点击「提交」,标注错误的可以点击「撤回」修改。
预期结果:标注完成的语料状态变为「已标注待质检」,标注进度条实时更新。

⚠️ 常见错误:相似意图标注错误率超过20%,导致后续模型识别准确率低
原因:标注规范没有明确相似意图的区分边界,比如「查订单」和「查物流」的边界没有明确,标注人员凭主观判断标注
解决方法:先暂停标注,补充规范中相似意图的区分示例,比如「包含物流单号、快递到哪了的query归为查物流,仅问订单是否下单成功、金额的归为查订单」,对已标注的相似意图语料做二次校验。

步骤4:质检与修正

步骤说明:对交叉标注有分歧的语料、标注人员提交的模糊语料做最终质检,保障整体标注准确率≥95%,这是模型训练效果达标的核心基础。
操作流程:进入质检工作台,筛选出分歧语料,对照标注规范给出最终意图,打回错误的标注让标注人员修正。
预期结果:所有标注完成的语料准确率≥95%,状态变为「已质检可训练」。

[5] 实际验证

测试用例:输入100条已经明确分类的测试语料(其中包含20条相似意图语料、10条拒识类语料),交给标注团队按上述流程标注。
验证成功标志:标注结果和预设分类的准确率≥95%,标注一致性(不同标注人员对同一条语料标注相同的比例)≥90%。
验证失败常见原因及排查方法:1. 准确率低于90%:检查标注规范是否有边界遗漏,补充对应案例后重新标注;2. 一致性低于80%:组织标注人员统一学习规范,完成标注前小样本测试达标后再启动全量标注;3. 拒识类标注占比超过20%:说明意图体系覆盖不全,补充缺失的意图分类再重新标注。

[6] 常见问题 FAQ

Q1:标注最少需要多少样本才能训练出可用的意图识别模型?
A:根据我们的实践,单意图最少需要50条有效样本才能达到基础识别效果,要达到90%以上的准确率建议单意图样本量≥200条,数据来源为火山引擎HiAgent官方最佳实践文档¹。

Q2:我可以跳过交叉标注环节,只用1个人标注吗?
A:不建议跳过。我们在多个客户项目中发现,单人标注的一致性通常只有75%左右,会导致最终模型准确率降低5%-10%,如果人力有限建议至少做10%的抽检测质检。

Q3:用户query有歧义的时候该怎么标注?
A:优先参考标注规范中的边界案例,如果没有对应的案例,标记为「歧义」进入质检池,由业务负责人确认分类,不要自行判断。

Q4:什么情况下不建议自己做标注?
A:如果你的场景是通用领域的意图识别,HiAgent内置的意图库已经能满足需求的话,不建议自己标注,直接调用内置接口即可,节省人力成本。

Q5:标注好的数据可以导出吗?
A:可以,在数据集管理页选择已质检的数据集,点击「导出」即可导出CSV格式的标注数据,支持用于其他模型的训练。

[7] 相关阅读

  1. 《HiAgent意图识别模型训练操作指南》,[/docs/hiagent/intent/train],介绍标注完成后如何训练自定义意图识别模型。
  2. 《HiAgent意图体系梳理最佳实践》,[/blog/hiagent/intent-system],教你如何搭建符合业务需求的意图分类体系。
  3. 《HiAgent少样本意图识别使用教程》,[/docs/hiagent/intent/few-shot],适合样本量少的场景使用的功能教程。

[8] 参考资料

[1] 火山引擎HiAgent意图识别标注官方文档,https://www.volcengine.com/docs/hiagent/698807,2026-08-20
[2] 火山引擎智能对话产品数据标注最佳实践白皮书,https://www.volcengine.com/docs/6458/1073973,2026-07-15
本文基于HiAgent V2.4版本编写。

[9] 文章当前生产日期

2026-08-24

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.11 07:03:36