Microsoft Azure Computer Vision OCR遇制表符输出换行的客户端配置问询
Azure 计算机视觉 OCR 空白字符误判换行的优化方案
当前 Azure 计算机视觉 OCR 服务的空白字符判定逻辑完全由服务端内置规则控制,不存在客户端侧可直接修改该判定行为的配置项,你可以通过以下三类方案间接优化识别结果:
- 请求参数调优
调用 OCR 接口时将readingOrder参数设置为natural,接口会优先遵循文档物理排版的自然顺序输出内容,可大幅减少宽间隔、制表符类水平空白被误判为换行的情况,对结构化表格、排版规整的印刷文档优化效果尤为明显。 - 识别结果后处理校正
利用接口返回的每个文本块的边界框(boundingBox)坐标做二次校验:如果两个被接口标记为不同行的文本块,边界框的顶部Y坐标差值小于单行行高的15%(阈值可根据自身文档场景灵活调整),即可判定为同一行内容,将二者之间的换行符替换为对应长度的空格或制表符即可。 - 输入图像预处理
针对存在大量超宽水平空白的输入图像,可提前做水平方向的空白压缩处理,也可在过宽的空白区域插入低透明度细竖线作为分割标记,降低服务端将水平空白误识别为行分隔的概率。
内容的提问来源于stack exchange,提问作者A.Rowan
相关产品推荐
相关产品推荐

