不使用Amazon S3能否调用Amazon Textract提取PDF文件信息?
Amazon Textract本地PDF调用方案说明
能否不将PDF上传至S3直接调用Textract服务,取决于你使用的API类型和待处理PDF的属性
- 处理**单页PDF(文件体积≤5MB)**时,可直接调用同步API,无需上传到S3
- 调用时直接在
Document参数中传入本地PDF的字节流(若直接调用REST接口,传入字节流的Base64编码即可),无需指定S3存储路径 - 注意同步API仅支持单页PDF输入,多页PDF即使体积符合要求也会调用失败
- 调用时直接在
- 处理多页PDF或体积超过5MB的PDF时,必须使用异步API,该类接口仅支持S3存储对象作为输入,无绕过S3的方案
- 异步API的设计定位就是处理大体积、多页的长文档,服务端需要持久化存储源支撑异步任务拉取处理,因此强制要求输入文件存放在S3中
Python SDK调用示例(单页本地PDF)
import boto3 # 初始化Textract客户端,需提前配置好AWS身份凭证 textract_client = boto3.client('textract') # 读取本地单页PDF文件 with open("本地测试文件.pdf", "rb") as pdf_file: pdf_content = pdf_file.read() # 调用同步分析接口,直接传入字节流 response = textract_client.analyze_document( Document={ 'Bytes': pdf_content }, FeatureTypes=["TABLES", "FORMS"] # 可按需调整要提取的特征类型 ) # 后续逻辑处理返回的识别结果 print(response)
内容的提问来源于stack exchange,提问作者jkortner
相关产品推荐
相关产品推荐

