Google Document AI训练测试数据集INVALID_DATASET错误求助
Google Document AI自定义处理器训练INVALID_DATASET错误排查方案
问题现象
使用自定义处理器训练发票PDF解析模型时,训练/测试数据集均触发INVALID_DATASET错误,错误信息显示的标注文档数/实体数与处理器页面统计的数量不符,涉及两种典型错误:
- 特定标签的有效标注文档数未达最低要求(如
charges标签要求10个,但报错显示仅8个) - 实体类型(如
account_number)违反text_anchor约束,有效实体数未达最低要求
排查与解决步骤
1. 验证标注的有效性
- 强制绑定文本锚点:所有实体标注必须在PDF页面上框选对应文本片段,仅输入实体值但未关联文本的标注会被系统判定无效,不计入统计(对应
text_anchor约束错误)。 - 检查标注完整性:逐个排查训练/测试集文档,确认每个启用的标签(如account number、发票号等)都已完成有效标注,漏标或标注不符合schema定义的文档会被排除在有效统计之外。
- 确认禁用标签的影响:如果schema中禁用了部分标签,需确保这些标签的标注已被清理,避免干扰数据集校验逻辑。
2. 修正数据集统计不一致问题
- 刷新页面核对统计:处理器页面显示的标注数量可能存在缓存,刷新后查看实际有效标注数是否与报错信息一致。
- 重新上传异常文档:若部分文档的标注无法被系统识别,删除后重新上传并按照规范完成标注,确保每个实体都绑定文本锚点。
- 调整数据集拆分:自动拆分训练/测试集时,可能导致某一子集的标注数量不满足最低要求,可手动调整拆分比例或补充对应标签的标注文档至要求数量(如报错中的10个)。
3. 检查Schema配置
- 确认实体约束设置:查看schema中
account_number等实体的定义,确认是否强制要求text_anchor(发票解析场景建议保留该约束),若无需此约束可调整schema配置后重新训练。 - 核对标签启用状态:确保训练时需要提取的标签(如计费周期、发票日期)已在schema中启用,禁用标签的标注不会被纳入训练统计。
内容的提问来源于stack exchange,提问作者H.I. McDunnough
相关产品推荐
相关产品推荐

