You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Google Document AI训练测试数据集INVALID_DATASET错误求助

Google Document AI自定义处理器训练INVALID_DATASET错误排查方案

问题现象

使用自定义处理器训练发票PDF解析模型时,训练/测试数据集均触发INVALID_DATASET错误,错误信息显示的标注文档数/实体数与处理器页面统计的数量不符,涉及两种典型错误:

  1. 特定标签的有效标注文档数未达最低要求(如charges标签要求10个,但报错显示仅8个)
  2. 实体类型(如account_number)违反text_anchor约束,有效实体数未达最低要求

排查与解决步骤

1. 验证标注的有效性

  • 强制绑定文本锚点:所有实体标注必须在PDF页面上框选对应文本片段,仅输入实体值但未关联文本的标注会被系统判定无效,不计入统计(对应text_anchor约束错误)。
  • 检查标注完整性:逐个排查训练/测试集文档,确认每个启用的标签(如account number、发票号等)都已完成有效标注,漏标或标注不符合schema定义的文档会被排除在有效统计之外。
  • 确认禁用标签的影响:如果schema中禁用了部分标签,需确保这些标签的标注已被清理,避免干扰数据集校验逻辑。

2. 修正数据集统计不一致问题

  • 刷新页面核对统计:处理器页面显示的标注数量可能存在缓存,刷新后查看实际有效标注数是否与报错信息一致。
  • 重新上传异常文档:若部分文档的标注无法被系统识别,删除后重新上传并按照规范完成标注,确保每个实体都绑定文本锚点。
  • 调整数据集拆分:自动拆分训练/测试集时,可能导致某一子集的标注数量不满足最低要求,可手动调整拆分比例或补充对应标签的标注文档至要求数量(如报错中的10个)。

3. 检查Schema配置

  • 确认实体约束设置:查看schema中account_number等实体的定义,确认是否强制要求text_anchor(发票解析场景建议保留该约束),若无需此约束可调整schema配置后重新训练。
  • 核对标签启用状态:确保训练时需要提取的标签(如计费周期、发票日期)已在schema中启用,禁用标签的标注不会被纳入训练统计。

内容的提问来源于stack exchange,提问作者H.I. McDunnough

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 07:52:50