You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Google Document AI识别多栏PDF列间距被忽略的问题求助

解决Google Document AI识别希伯来语两栏PDF的列合并问题

要修复两栏文本被识别为单栏的问题,核心是让模型识别布局并基于坐标拆分列,具体步骤如下:

  • 启用布局分析功能
    基础OCR不会自动识别多栏结构,必须调用Document OCR服务并开启LAYOUT_DETECTION特性。在API请求的features字段中添加该参数,模型会返回每个文本块的边界坐标、栏位归属等布局信息。

  • 基于坐标拆分文本列
    利用返回的文本块坐标(boundingPoly)按栏分组拼接:

    1. 由于希伯来语是从右到左阅读,优先按文本块的右侧X坐标分组——右侧坐标更大的块属于第一栏,更小的属于第二栏;
    2. 同一栏内的文本块,按顶部Y坐标从上到下排序;
    3. 分别拼接每一栏的文本,得到符合预期的分栏结果。

    对应你的示例,处理后会把右侧栏的text of first和more text test拼接,左侧栏的text of second和second test拼接,输出符合预期的分栏文本。

  • 优化模型参数提升精度
    若布局检测效果不佳,可进一步调整:

    • 使用Premium Document OCR模型,它对复杂多栏布局的识别能力更强;
    • 在请求中设置languageHints为["he"],明确指定希伯来语,帮助模型适配从右到左的文本排版逻辑。

内容的提问来源于stack exchange,提问作者medic17

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.19 14:52:08