如何正确使用Google Vision OCR完整提取轮胎图片中的文字信息
解决方案
- 调整API请求参数
你当前仅配置了LOGO_DETECTION和DOCUMENT_TEXT_DETECTION两种特性,且DOCUMENT_TEXT_DETECTION的maxResults仅设为100,不足以覆盖全图所有低权重的小尺寸文本。可按如下逻辑修改请求配置:- 新增
TEXT_DETECTION类型特性,该特性针对稀疏场景文字的识别效果优于面向文档密集文本的DOCUMENT_TEXT_DETECTION,适配轮胎上分散的字符场景 - 将两种文本检测特性的
maxResults拉满到允许的上限值 - 新增
imageContext配置,指定英文语言提示、启用最新识别模型、返回所有置信度维度的结果
参考配置代码:
const features = [ { "maxResults": 50, "type": "LOGO_DETECTION" }, { "maxResults": 1000, "type": "DOCUMENT_TEXT_DETECTION" }, { "maxResults": 1000, "type": "TEXT_DETECTION" } ]; const imageContext = { languageHints: ["en"], textDetectionParams: { enableTextDetectionConfidenceScore: true, model: "builtin/latest" } }; - 新增
- 遍历底层返回字段提取全量文本
当前你提取的description是API自动拼接的高置信度文本结果,大量低置信度的小尺寸字符不会被纳入该字段。你可以直接遍历返回结果中fullTextAnnotation.pages[].blocks[].paragraphs[].words[].symbols[]下的所有字符元素,不管置信度高低全部提取后自行做拼接、去重、排序处理,即可获取到API识别到的全部文本内容。 - 增加图片预处理步骤
你已经验证裁剪局部区域后识别效果正常,可自动化实现图片预处理逻辑:先通过边缘检测识别轮胎的圆形轮廓,将环形分布的轮胎侧面按角度切片为多张子图,分别提交API识别后再合并结果,即可解决全图中小尺寸字符占比过低导致的漏识别问题。
内容的提问来源于stack exchange,提问作者ilellouch
相关产品推荐
相关产品推荐

