You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure Document Intelligence组合模型未知文档类型处理方案咨询

处理Document Intelligence组合模型未知文档类型的实用方案

1. 开启组合模型的严格匹配模式

组合模型默认会硬凑最接近的训练文档类型,哪怕输入是完全陌生的格式。调用API时把strictDocumentTypeValidation参数设为true,这样模型匹配不到任何训练过的类型时,会直接返回未识别结果,不会强行提取字段。

2. 加一层自定义业务规则校验

别光靠置信度过滤,自己加校验逻辑:

  • 检查核心必填字段是否存在,格式是否符合业务要求(比如日期格式、发票号规则)
  • 统计有效提取字段的数量,如果远少于训练文档的平均字段数,直接判定为未知文档
  • 对比文档布局特征(比如段落数、关键区域位置)和训练集的差异,差太多就标记为未知

3. 重构分类模型的训练逻辑

之前分类模型没用,大概率是训练数据或策略有问题:

  • 多收集非目标格式的文档当负样本,让模型学会识别“不属于任何已知类型”的特征
  • 调整分类阈值,降低已知类型的判定门槛,或者提高未知类别的召回率,确保陌生文档能被揪出来
  • 换成多标签分类,让模型同时判断是否属于已知类型,不属于就归为未知

4. 用基础OCR特征先过滤一遍

先做基础OCR分析,提前筛掉明显不对的文档:

  • 检查文档语言和训练集是否一致,不一致直接过滤
  • 识别文档结构(比如是纯文本、表格还是特定格式表单),如果和所有训练文档结构差异大,直接标记为未知

5. 计算整体文档的置信度得分

别盯着单个字段的高置信度,看整体:

  • 把所有提取字段的置信度取平均,或者给核心字段加权算总分
  • 设置整体得分阈值,低于阈值的直接判定为未知文档
  • 遇到置信度高但不符合业务逻辑的字段,直接标记无效,结合其他字段情况综合判断

内容的提问来源于stack exchange,提问作者Aakash Nakarmi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.16 16:07:09