You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

AWS Textract提取PDF文本未保留换行,如何保留原格式?

AWS Textract 保留PDF原行结构提取方案

问题核心原因

Textract默认的文本拼接逻辑会将视觉间距较近的文本块合并,即便原PDF中是独立行,也可能被拼成单行,不会直接保留原生换行结构。

可行解决方案

1. 利用布局分析结果直接还原行结构(推荐)

Textract的AnalyzeDocument(同步/异步)接口支持返回布局层级的Block数据,其中LINE类型的Block对应原PDF中的单行文本,无需额外配置,直接解析即可还原原结构:

  • 调用接口时指定FeatureTypes=["LAYOUT"]
  • 遍历返回结果的Blocks数组,筛选BlockType="LINE"的条目,按Top坐标(页面从上到下的位置)排序后,将每个LINE的Text单独换行拼接

示例Python代码:

import boto3

def extract_text_with_line_structure(pdf_file_path):
    textract_client = boto3.client('textract')
    
    with open(pdf_file_path, 'rb') as doc_file:
        response = textract_client.analyze_document(
            Document={'Bytes': doc_file.read()},
            FeatureTypes=['LAYOUT']
        )
    
    # 提取所有行级Block并按页面从上到下排序
    line_blocks = [block for block in response['Blocks'] if block['BlockType'] == 'LINE']
    line_blocks.sort(key=lambda x: x['Geometry']['BoundingBox']['Top'])
    
    # 按原行结构拼接文本
    structured_text = '\n'.join([block['Text'] for block in line_blocks])
    return structured_text

2. 对已拼接文本做后处理拆分

如果已经拿到合并后的文本,可通过两种方式拆分:

  • 基于固定关键词拆分:比如遇到“Seller:”“Buyer:”这类模块标识时,手动插入换行符
  • 利用WORD级Block判断:每个WORD有独立坐标,若相邻两个WORD的Y坐标差超过行高的1.5倍,视为换行节点,插入换行

额外注意事项

  • 处理大PDF时用异步接口StartDocumentAnalysis,返回结果同样包含布局Block信息
  • 若PDF是多列布局,需额外通过X坐标区分列,避免行顺序混乱

内容的提问来源于stack exchange,提问作者tt0206

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.12 03:50:57