You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

不使用Amazon S3能否调用Amazon Textract提取PDF文件信息?

Amazon Textract本地PDF调用方案说明

能否不将PDF上传至S3直接调用Textract服务,取决于你使用的API类型和待处理PDF的属性

  • 处理**单页PDF(文件体积≤5MB)**时,可直接调用同步API,无需上传到S3
    • 调用时直接在Document参数中传入本地PDF的字节流(若直接调用REST接口,传入字节流的Base64编码即可),无需指定S3存储路径
    • 注意同步API仅支持单页PDF输入,多页PDF即使体积符合要求也会调用失败
  • 处理多页PDF或体积超过5MB的PDF时,必须使用异步API,该类接口仅支持S3存储对象作为输入,无绕过S3的方案
    • 异步API的设计定位就是处理大体积、多页的长文档,服务端需要持久化存储源支撑异步任务拉取处理,因此强制要求输入文件存放在S3中

Python SDK调用示例(单页本地PDF)

import boto3

# 初始化Textract客户端,需提前配置好AWS身份凭证
textract_client = boto3.client('textract')

# 读取本地单页PDF文件
with open("本地测试文件.pdf", "rb") as pdf_file:
    pdf_content = pdf_file.read()

# 调用同步分析接口,直接传入字节流
response = textract_client.analyze_document(
    Document={
        'Bytes': pdf_content
    },
    FeatureTypes=["TABLES", "FORMS"] # 可按需调整要提取的特征类型
)

# 后续逻辑处理返回的识别结果
print(response)

内容的提问来源于stack exchange,提问作者jkortner

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.05 06:12:01