关于Cloud Vision OCR额外可提取内容及提取方法的技术咨询
Cloud Vision OCR 可提取的额外信息及实现方法
可提取的非文本/坐标类信息
- 语言标识:自动识别文本对应的语言,支持超过100种语言及方言,结果包含具体语言代码。
- 文本层级结构:拆分文档为段落、行、单词、字符的层级结构,明确排版逻辑。
- 识别置信度:为每个识别出的文本片段(字符、单词、段落)返回0-1的置信度评分,体现结果可靠性。
- 文本类型区分:识别并区分印刷体与手写体文本,适配混合排版场景。
- 文档旋转角度:检测文档的倾斜/旋转角度,支持后续校正处理。
- 结构化证件信息:针对身份证、护照、驾照等特定证件,可提取结构化字段(如姓名、证件编号、有效期),属于专用OCR能力。
提取操作方法
- 基础OCR调用(如
DOCUMENT_TEXT_DETECTION或TEXT_DETECTION):- 语言标识:响应中
languageCode字段直接返回识别出的语言代码;若需指定候选语言,可在请求中设置languageHints参数。 - 层级结构与置信度:默认响应包含
pages→blocks→paragraphs→words→symbols的层级,每个节点都带有confidence字段。 - 文本类型区分:启用
DOCUMENT_TEXT_DETECTION特征后,响应中部分文本片段会标记手写体属性;特定场景可结合HANDWRITING_DETECTION特征强化识别。 - 旋转角度:
pages节点下的rotation字段即为文档的旋转角度值。
- 语言标识:响应中
- 结构化证件信息:调用对应专用API(如ID Card OCR),无需额外配置,直接返回结构化的字段结果。
内容的提问来源于stack exchange,提问作者Daniel Schutz
相关产品推荐
相关产品推荐

