Google Cloud Vision API是否支持类似AWS Textract返回键值对格式响应?
Google Cloud Vision 键值对OCR能力解答
Google Cloud 基础Vision API的DOCUMENT_TEXT_DETECTION通用文档识别接口本身不支持开箱即用的键值对格式返回,该接口仅返回文本内容、边界坐标、识别置信度三类信息,没有隐藏的OOB配置项可以直接开启KV结构化输出。
如果需要和AWS Textract对齐的KV提取能力,可使用Google Cloud官方的Document AI 表单解析器组件,这是专门针对表单、票据这类结构化文档推出的开箱即用能力,无需自定义训练模型,调用后会自动返回识别到的键、对应值、二者的匹配关系及关联坐标信息,完全适配你的业务需求。
如果你的场景必须依赖基础Vision API实现KV提取,需要自行做后处理开发,通用实现逻辑如下:
- 对接口返回的所有文本块,结合边界坐标按从上到下、从左到右的阅读顺序做排序
- 识别带表单特征标识的文本作为候选键,比如包含冒号、括号等特殊符号的内容
- 基于坐标相对位置匹配对应的值,比如同一行键右侧的文本、相邻行键下方的对齐文本
内容的提问来源于stack exchange,提问作者Abhishek Dasgupta
相关产品推荐
相关产品推荐

