Document AI自定义OCR提取器跨页标注异常:仅首页识别准确
Google Document AI自定义OCR仅首页预测准确的问题分析与解决
一、仅首页预测准确的核心原因
- 页面上下文关联缺失:Document AI的自定义提取模型会默认学习文档的整体结构关联,但如果标注时没明确区分不同页面的标签归属逻辑,模型可能误以为所有标签都该出现在首页,后续页面的标签因为没和页面位置建立关联,自然无法正确识别。
- 标注数据分布偏差:如果训练集里大部分文档的关键标签都集中在首页,或者后续页面的标注样本量不足、标注规则不一致,模型会倾向于只在首页预测标签,直接忽略后续页面的内容。
- Schema设计缺乏页面区分:虽然你做了覆盖所有页面的Schema,但如果没给不同页面的标签设置页面上下文约束(比如指定某标签仅出现在第2页,或某类标签属于“详情页”组),模型根本分不清不同页面的标签适用场景。
二、当前标注方式的问题
你现在的标注方式(只标当前页面存在的标签,其余留空)不完全正确,主要漏了两个关键步骤:
- 没明确标记“标签不存在”的状态:留空标签会让模型搞不清是“没标注”还是“确实不存在”。Document AI需要明确的“不存在”标记(大部分版本的标注工具都有对应选项,比如勾选“此标签本页不出现”),否则模型会混淆这两种语义。
- 没建立页面位置和标签的关联:标注时没给标签绑定页面属性(比如指定这个标签属于“首页”“第3页”或者“详情页”类别),模型学不到标签在不同页面的分布规律。
三、修复方案
- 修正标注逻辑:
- 对于当前页面不存在的标签,别留空,直接明确标记为“不存在”(在标注工具里找对应选项)。
- 给每个标注的标签加上页面位置元数据,如果工具支持的话;或者在Schema里给标签加
page_type属性(比如company_name对应page_type: "封面页",invoice_item对应page_type: "详情页")。
- 平衡训练数据分布:
- 确保训练集里每种页面类型(首页、详情页等)的标注样本数量均衡,别让某类页面样本太少。
- 检查后续页面的标注一致性,保证同类型页面的标签标注规则统一。
- 优化Schema设计:
- 按页面类型给标签分组,比如创建
封面页字段和详情页字段两个子Schema,明确不同页面对应的标签集合。 - 给跨页面出现的标签加上下文关联规则(比如
发票编号在首页和详情页都出现,但属于同一个实体)。
- 按页面类型给标签分组,比如创建
内容的提问来源于stack exchange,提问作者Cookie Monster
相关产品推荐
相关产品推荐

