如何使用pdfplumber读取S3存储桶中的PDF文件?
解决pdfplumber读取S3存储桶中PDF文件的问题
问题分析
你尝试的三种方法失败的原因分别是:
- 直接传入S3 URL:pdfplumber不支持直接识别S3协议地址,底层需要具备
seek方法的类文件对象,S3 URL无法提供该能力。 - 使用预签名URL:
pdfplumber.open()默认将字符串参数当作本地文件路径处理,预签名URL是超长HTTP链接,会触发文件名过长的系统错误。 - 直接传入bytes对象:
pdfplumber.open()要求参数是类文件对象(需实现seek、read等方法),而bytes对象不具备这些方法。
正确解决方案
将S3文件内容读取到BytesIO对象中,它是模拟文件操作的内存对象,完全符合pdfplumber的要求。
import pdfplumber import boto3 from io import BytesIO # 初始化S3客户端 s3 = boto3.client('s3') bucket_name = "example-s3-bucket" file_key = "example.pdf" # 获取S3文件内容并包装为BytesIO类文件对象 response = s3.get_object(Bucket=bucket_name, Key=file_key) pdf_stream = BytesIO(response['Body'].read()) # 正常读取并处理PDF with pdfplumber.open(pdf_stream) as pdf: # 示例:提取每页文本 for page in pdf.pages: page_text = page.extract_text() print(page_text)
说明
BytesIO在内存中模拟了文件的读写行为,支持seek和read方法,完美适配pdfplumber的底层依赖,无需将PDF下载到本地磁盘即可完成解析。
内容的提问来源于stack exchange,提问作者Howard S
相关产品推荐
相关产品推荐

