如何在Google Document AI/OCR中保留文本空间完整性以构建指标DataFrame
启用布局检测与结构化输出
Google Document AI的通用OCR默认可能仅提取纯文本,忽略排版布局。调用API时需开启布局检测功能,在请求参数的features中指定DOCUMENT_TEXT_DETECTION或LAYOUT_DETECTION,这样返回的结果会包含每个文本元素的坐标、行归属等结构化信息,为还原原图排版提供依据。基于坐标信息重构文本排版
利用OCR结果中每个文本元素的y轴坐标判断是否属于同一行,x轴坐标确定行内元素的左右顺序,以此还原换行、缩进、对齐等格式。例如将y坐标差值在阈值内的单词归为同一行,按x坐标排序后拼接,即可还原原图的行结构。使用专用处理器适配结构化文档
如果你的图片是表格或表单类结构化文档,通用OCR容易丢失格式。可选用Google Document AI的Form Parser处理器,它针对表单、表格优化,能直接识别行列结构并输出结构化数据,无需手动还原格式就能提取Rate、RR、PR等指标对应的数值。调整API参数优化识别精度
调用API时,通过image_context设置language_hints指定文档语言,避免因语言识别偏差导致格式混乱;开启enable_image_quality_scores让AI优先识别清晰区域文本,提升格式还原的准确性。后处理修正格式细节
若OCR返回文本仍有少量格式偏差,可通过后处理修正:比如根据原图的排版规律(如指标与数值是否同行),用正则匹配行内关键词和数值,或统计文本行长度、对齐方式来调整排版。
内容的提问来源于stack exchange,提问作者Raaghav Rammohan

