You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

关于Cloud Vision OCR额外可提取内容及提取方法的技术咨询

Cloud Vision OCR 可提取的额外信息及实现方法

可提取的非文本/坐标类信息

  • 语言标识:自动识别文本对应的语言,支持超过100种语言及方言,结果包含具体语言代码。
  • 文本层级结构:拆分文档为段落、行、单词、字符的层级结构,明确排版逻辑。
  • 识别置信度:为每个识别出的文本片段(字符、单词、段落)返回0-1的置信度评分,体现结果可靠性。
  • 文本类型区分:识别并区分印刷体与手写体文本,适配混合排版场景。
  • 文档旋转角度:检测文档的倾斜/旋转角度,支持后续校正处理。
  • 结构化证件信息:针对身份证、护照、驾照等特定证件,可提取结构化字段(如姓名、证件编号、有效期),属于专用OCR能力。

提取操作方法

  • 基础OCR调用(如DOCUMENT_TEXT_DETECTION或TEXT_DETECTION):
    • 语言标识:响应中languageCode字段直接返回识别出的语言代码;若需指定候选语言,可在请求中设置languageHints参数。
    • 层级结构与置信度:默认响应包含pages→blocks→paragraphs→words→symbols的层级,每个节点都带有confidence字段。
    • 文本类型区分:启用DOCUMENT_TEXT_DETECTION特征后,响应中部分文本片段会标记手写体属性;特定场景可结合HANDWRITING_DETECTION特征强化识别。
    • 旋转角度:pages节点下的rotation字段即为文档的旋转角度值。
  • 结构化证件信息:调用对应专用API(如ID Card OCR),无需额外配置,直接返回结构化的字段结果。

内容的提问来源于stack exchange,提问作者Daniel Schutz

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.19 06:00:02