Azure Document Intelligence组合模型未知文档类型处理方案咨询
处理Document Intelligence组合模型未知文档类型的实用方案
1. 开启组合模型的严格匹配模式
组合模型默认会硬凑最接近的训练文档类型,哪怕输入是完全陌生的格式。调用API时把strictDocumentTypeValidation参数设为true,这样模型匹配不到任何训练过的类型时,会直接返回未识别结果,不会强行提取字段。
2. 加一层自定义业务规则校验
别光靠置信度过滤,自己加校验逻辑:
- 检查核心必填字段是否存在,格式是否符合业务要求(比如日期格式、发票号规则)
- 统计有效提取字段的数量,如果远少于训练文档的平均字段数,直接判定为未知文档
- 对比文档布局特征(比如段落数、关键区域位置)和训练集的差异,差太多就标记为未知
3. 重构分类模型的训练逻辑
之前分类模型没用,大概率是训练数据或策略有问题:
- 多收集非目标格式的文档当负样本,让模型学会识别“不属于任何已知类型”的特征
- 调整分类阈值,降低已知类型的判定门槛,或者提高未知类别的召回率,确保陌生文档能被揪出来
- 换成多标签分类,让模型同时判断是否属于已知类型,不属于就归为未知
4. 用基础OCR特征先过滤一遍
先做基础OCR分析,提前筛掉明显不对的文档:
- 检查文档语言和训练集是否一致,不一致直接过滤
- 识别文档结构(比如是纯文本、表格还是特定格式表单),如果和所有训练文档结构差异大,直接标记为未知
5. 计算整体文档的置信度得分
别盯着单个字段的高置信度,看整体:
- 把所有提取字段的置信度取平均,或者给核心字段加权算总分
- 设置整体得分阈值,低于阈值的直接判定为未知文档
- 遇到置信度高但不符合业务逻辑的字段,直接标记无效,结合其他字段情况综合判断
内容的提问来源于stack exchange,提问作者Aakash Nakarmi
相关产品推荐
相关产品推荐

