启用invoice_type后GCloud Document AI训练报错求助
问题原因及解决办法
错误根源
错误日志明确指出,invoice_type实体缺少entities.text_anchor.text_segments字段(要求至少1个,实际为0),核心原因是你把invoice_type的实体类型配置成了「提取型实体」,但实际使用场景是「文档分类标签」。
具体原因
- 提取型实体:用于标记文档内的具体文本内容,必须绑定文本位置(即
text_anchor字段),系统会强制校验该字段是否存在。 - 分类型实体:用于给整个文档打类别标签,不需要关联任何具体文本片段,因此不需要
text_anchor字段。
你的标注格式是分类型实体的正确格式:
{ "id": "a47c19621d45f83d", "normalizedValue": { "text": "invoice_statement" }, "type": "invoice_type" }
但系统按提取型实体的规则校验,所以触发了「无效文档」的错误。
解决步骤
- 打开Google Cloud控制台的Document AI数据集页面,找到训练用的目标数据集
- 进入实体类型配置界面,定位
invoice_type实体 - 将该实体的类型从「提取型」修改为「分类型」(控制台对应选项一般显示为
Classification) - 确认所有标注的
invoice_type格式保持不变(无需添加text_anchor) - 重新发起训练任务
内容的提问来源于stack exchange,提问作者Christian Schmitt
相关产品推荐
相关产品推荐

