Google Document AI智能文档质量处理器不可用,如何获取文档质量分数?
解决Google Document AI质量分数获取问题的思路
首先得澄清一个关键点:General OCR处理器的文档质量分数并不存储在entities数组中,你可能找错了位置;另外,先排查下你无法使用Intelligent Document Quality Processor的核心原因,这才是最直接的解决方案。
一、先排查Intelligent Document Quality Processor无法使用的原因
- 确认你的Google Cloud项目已经启用了Document AI API
- 检查处理器所在的区域:该处理器仅支持
us-central1、europe-west1、asia-southeast1等特定区域,如果你选择了不支持的区域会导致无法调用 - 验证权限:确保你的服务账号拥有
roles/documentai.editor或更高权限,能创建和调用该处理器
二、通过General OCR获取文档质量分数的正确方式
如果你暂时无法使用专用质量处理器,用General OCR获取质量分数的正确步骤是:
- 在调用General OCR的API请求中,务必添加
DOCUMENT_QUALITY特征:{ "requests": [ { "inputConfig": { "gcsSource": { "uri": "gs://your-bucket/document.pdf" }, "mimeType": "application/pdf" }, "features": [ { "type": "DOCUMENT_TEXT_DETECTION" }, { "type": "DOCUMENT_QUALITY" } // 必须添加这个特征才能获取质量数据 ] } ] } - 在响应结果中,质量分数存储在
document.quality字段下,而不是entities数组里:
响应示例片段:
你需要直接读取这个字段,而不是遍历"document": { "quality": { "qualityScore": 0.85, "detectedDefects": [ { "type": "BLURRINESS", "confidence": 0.3 } ] } }entities来找。
三、常见误区纠正
- 不要混淆不同处理器的输出结构:专用的质量处理器会返回更详细的质量评估结果(比如缺陷类型、区域定位),而General OCR的质量评估是基础版,仅提供整体分数和简单缺陷标识
- 实体(
entities)主要用于提取结构化数据(比如日期、金额、地址),文档质量属于元数据范畴,不会被归类为实体
内容的提问来源于stack exchange,提问作者richard
相关产品推荐
相关产品推荐

