训练Document AI表单OCR处理器遇无效数据集错误求助
Document AI训练数据集错误分析与修复方案
错误原因
- 核心问题:文档
5c7a8b0949921910.json里的telefone-contato-prestador标注实体中,text_anchor.text_segments字段长度为0,违反了训练要求的「至少包含1个文本片段」规则,这是触发Invalid dataset错误的直接原因。 - 排除文档数量问题:你已使用10份训练文档,满足Document AI自定义模型训练的最低数据量要求(通常为10份),所以数量不足不是报错原因。
修正步骤
- 定位问题源:找到
5c7a8b0949921910.json对应的原始表单,确认telefone-contato-prestador(服务商联系电话)字段是否有有效文本。 - 修复标注JSON:
- 若原始表单该字段有内容:补充
text_segments的正确索引信息,示例格式如下:"entities": [ { "type": "telefone-contato-prestador", "text_anchor": { "text_segments": [ { "start_index": "xxx", "end_index": "yyy" } ] } } ] - 若原始表单该字段确实为空:要么删除该字段对应的实体标注,要么通过标注工具标记为「无内容」(部分工具会生成符合规则的空值标注结构)。
- 若原始表单该字段有内容:补充
- 批量排查:因为字段数量多,建议批量检查所有训练/测试文档的标注JSON,确保所有实体的
text_segments都满足至少1个的要求,避免其他文档存在同类问题。
内容的提问来源于stack exchange,提问作者Rodrigo Martins
相关产品推荐
相关产品推荐

