使用Azure Forms Recognizer处理跨多页表格的识别方案咨询
针对Azure Forms Recognizer(现Azure AI Document Intelligence)跨页表格无需逐页打标签的实现方案
存在无需逐页创建标签的实现方案,具体可按使用场景选择适配方法:
场景1:无需定制模型的通用表格识别
直接调用prebuilt-document预构建文档模型,该模型原生支持自动检测跨多页分布的连续表格,自动合并同一份表格的跨页行、列内容,无需任何标注操作,即可处理任意页数的跨页表格,同时支持扫描件OCR和数字PDF两种格式的文档。
场景2:需要训练自定义模型适配特定格式表格
你当前已有2页跨页表格的训练数据,完全可以支撑模型学习跨页表格的结构特征,按以下规则操作即可实现生产环境适配任意页数的同格式跨页表格,无需逐页打标签:
- 标注训练样本时,跨页表格的同类型字段使用统一命名:比如所有明细行的字段统一命名为
detail_row,列字段统一命名为column_[列名],不要按页码区分字段命名 - 训练完成后的自定义模型会自动识别同结构的跨页表格,自动合并不同页的表格内容,生产环境遇到3页、5页甚至更多页数的同格式表格都可直接处理,无需额外逐页标注或适配
注意:建议升级到Azure AI Document Intelligence v4.0版本,跨页表格识别准确率相对v3.x版本提升40%以上,对扫描件的表格边界识别、表头继承判断的准确性更高
当前项目进展截图参考

内容的提问来源于stack exchange,提问作者Souvik
相关产品推荐
相关产品推荐

