Google Document AI识别多栏PDF列间距被忽略的问题求助
解决Google Document AI识别希伯来语两栏PDF的列合并问题
要修复两栏文本被识别为单栏的问题,核心是让模型识别布局并基于坐标拆分列,具体步骤如下:
启用布局分析功能
基础OCR不会自动识别多栏结构,必须调用Document OCR服务并开启LAYOUT_DETECTION特性。在API请求的features字段中添加该参数,模型会返回每个文本块的边界坐标、栏位归属等布局信息。基于坐标拆分文本列
利用返回的文本块坐标(boundingPoly)按栏分组拼接:- 由于希伯来语是从右到左阅读,优先按文本块的右侧X坐标分组——右侧坐标更大的块属于第一栏,更小的属于第二栏;
- 同一栏内的文本块,按顶部Y坐标从上到下排序;
- 分别拼接每一栏的文本,得到符合预期的分栏结果。
对应你的示例,处理后会把右侧栏的
text of first和more text test拼接,左侧栏的text of second和second test拼接,输出符合预期的分栏文本。优化模型参数提升精度
若布局检测效果不佳,可进一步调整:- 使用Premium Document OCR模型,它对复杂多栏布局的识别能力更强;
- 在请求中设置
languageHints为["he"],明确指定希伯来语,帮助模型适配从右到左的文本排版逻辑。
内容的提问来源于stack exchange,提问作者medic17
相关产品推荐
相关产品推荐

