You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何处理Google Document AI OCR API的JSON响应以生成结构化TXT文件?

将Google Document AI OCR的JSON响应转为结构化TXT文件

核心思路

Document AI的JSON响应包含文本内容及其空间位置信息,只需按阅读顺序(从上到下、从左到右)提取并拼接文本,即可生成符合预期的TXT文件。

具体步骤

  • 解析JSON层级:响应中的文本嵌套在pages→blocks→paragraphs→words层级下,每个段落/单词都带有boundingPoly字段,其中的坐标可用来确定文本的位置顺序。
  • 按空间排序文本:
    1. 以段落为单位,提取每个段落的顶部Y坐标(边界框第一个顶点的Y值)和左侧X坐标;
    2. 先按Y坐标从小到大排序(保证从上到下的顺序),Y值相同或接近的段落,再按X坐标从小到大排序(保证从左到右的顺序);
    3. 段落间添加换行符,页面间可按需添加分隔标识。

Python实现代码

import json

def docai_json_to_txt(json_file_path, output_txt_path):
    # 加载Document AI的JSON响应文件
    with open(json_file_path, 'r', encoding='utf-8') as json_file:
        doc_data = json.load(json_file)
    
    all_pages_text = []
    
    # 遍历每个页面处理
    for page in doc_data.get('pages', []):
        page_paragraphs = []
        
        # 提取所有段落的坐标和文本
        for block in page.get('blocks', []):
            for paragraph in block.get('paragraphs', []):
                # 获取段落顶部Y坐标(用于排序)
                para_top_y = paragraph['boundingPoly']['vertices'][0]['y']
                # 获取段落左侧X坐标
                para_left_x = paragraph['boundingPoly']['vertices'][0]['x']
                # 拼接段落内的所有单词文本
                para_text = ''.join([word['text'] for word in paragraph.get('words', [])])
                page_paragraphs.append((para_top_y, para_left_x, para_text))
        
        # 按阅读顺序排序段落
        page_paragraphs.sort(key=lambda item: (item[0], item[1]))
        # 拼接当前页面的文本,段落间换行
        page_text = '\n'.join([p[2] for p in page_paragraphs])
        all_pages_text.append(page_text)
    
    # 拼接所有页面的文本,页面间添加分隔线(可根据需求移除)
    final_text = '\n\n--- 页面分割线 ---\n\n'.join(all_pages_text)
    
    # 写入TXT文件
    with open(output_txt_path, 'w', encoding='utf-8') as txt_file:
        txt_file.write(final_text)

# 调用示例
docai_json_to_txt('docai_response.json', 'structured_output.txt')

优化说明

  • 如果需要更精准的换行判断,可以计算相邻段落的Y坐标差值,结合字体高度(从单词的边界框高度估算),当差值超过阈值(比如字体高度的1.5倍)时再添加换行;
  • 若不需要页面分隔线,直接用'\n\n'.join(all_pages_text)拼接即可;
  • 若要保留更细粒度的文本(如单词级),可调整代码直接提取单词并排序。

内容的提问来源于stack exchange,提问作者Raviprasad sathe

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.03 03:21:03