You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用pdfplumber读取S3存储桶中的PDF文件?

解决pdfplumber读取S3存储桶中PDF文件的问题

问题分析

你尝试的三种方法失败的原因分别是:

  • 直接传入S3 URL:pdfplumber不支持直接识别S3协议地址,底层需要具备seek方法的类文件对象,S3 URL无法提供该能力。
  • 使用预签名URL:pdfplumber.open()默认将字符串参数当作本地文件路径处理,预签名URL是超长HTTP链接,会触发文件名过长的系统错误。
  • 直接传入bytes对象:pdfplumber.open()要求参数是类文件对象(需实现seek、read等方法),而bytes对象不具备这些方法。

正确解决方案

将S3文件内容读取到BytesIO对象中,它是模拟文件操作的内存对象,完全符合pdfplumber的要求。

import pdfplumber
import boto3
from io import BytesIO

# 初始化S3客户端
s3 = boto3.client('s3')
bucket_name = "example-s3-bucket"
file_key = "example.pdf"

# 获取S3文件内容并包装为BytesIO类文件对象
response = s3.get_object(Bucket=bucket_name, Key=file_key)
pdf_stream = BytesIO(response['Body'].read())

# 正常读取并处理PDF
with pdfplumber.open(pdf_stream) as pdf:
    # 示例:提取每页文本
    for page in pdf.pages:
        page_text = page.extract_text()
        print(page_text)

说明

BytesIO在内存中模拟了文件的读写行为,支持seek和read方法,完美适配pdfplumber的底层依赖,无需将PDF下载到本地磁盘即可完成解析。

内容的提问来源于stack exchange,提问作者Howard S

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.02 06:12:38