如何训练Azure Form Recognizer识别可选字段及指定字段位置关联?
解决Azure Form Recognizer的两个核心问题
一、修复可选字段缺失时的错误映射问题
当目标可选字段不存在时模型乱映射到其他字段,按以下方式调整:
- 补充足够多无该字段的训练样本,让模型充分学习“字段缺失时返回空”的场景,避免过度匹配其他相似字段
- 标注阶段严格规范:对于没有目标字段的文档,绝对不要给其他字段标注目标标签,明确传递“此场景下该字段为空”的信号
- 训练前检查标签一致性,确保所有标注样本中目标标签的定义统一,没有歧义
- 训练时启用模型的严格匹配模式(如果支持),降低模型对非目标字段的误识别概率
二、定义字段与“Data de fim da sanção”的位置关联
要让模型识别目标字段始终位于“Data de fim da sanção”标签下方,可通过以下操作实现:
- 在Form Recognizer Studio标注界面,先选中“Data de fim da sanção”的标签区域,给其下方的目标字段标注时,利用工具的相对位置约束功能,直接关联两个字段的上下位置关系
- 准备训练样本时,确保所有含目标字段的文档中,它都严格处于“Data de fim da sanção”的下方,给模型建立明确的位置关联逻辑
- 如果通过API训练,可在标注数据的
boundingBox参数中,明确指定目标字段的边界框坐标范围在“Data de fim da sanção”的y轴坐标下方,强化位置关联 - 将“Data de fim da sanção”和目标字段设置为同一字段组,让模型把它们视为关联元素,提升位置识别的准确性
内容的提问来源于stack exchange,提问作者Andy Schmitt
相关产品推荐
相关产品推荐

