如何从Jupyter Notebook直接上传多Sheet Excel工作簿到Amazon S3
目标
在Jupyter Notebook中使用Python Pandas创建了多个不同的DataFrame,希望将它们作为独立工作表存入Excel工作簿,直接上传至Amazon S3,无需在本地存储中间文件。
现有可复现代码
本地存储中转的实现方式
## 构造两个测试DataFrame data1 = {'first_column': ['first_value','second_value'], 'second_column': ['first_value', 'second_value']} df1 = pd.DataFrame(data1) data2 = {'first_column': ['xvalue', 'yvalue'], 'second_column': ['xavalue', 'yavalue']} df2 = pd.DataFrame(data2) ## 将多个DataFrame写入本地Excel文件 with pd.ExcelWriter('fake_file.xlsx') as writer: df1.to_excel(writer, sheet_name='df1') df2.to_excel(writer, sheet_name='df2') ## 上传本地Excel文件到S3 import boto3 import pathlib import os s3 = boto3.client("s3") bucket_name = "my_bucket_name" object_name = "final_fake.xlsx" __file__ = "my_python_script.ipynb" file_name = os.path.join(pathlib.Path(__file__).parent.resolve(), "fake_file.xlsx") s3.upload_file(file_name, bucket_name, object_name)
已实现的单文件直传逻辑
目前已经可以实现单个DataFrame以CSV格式直接上传到S3,代码如下:
## 单个DataFrame以CSV格式直传S3 from io import StringIO import boto3 bucket = "my_bucket_name" csv_buffer = StringIO() df1.to_csv(csv_buffer) s3_resource = boto3.resource('s3') s3_resource.Object(bucket, 'df1.csv').put(Body=csv_buffer.getvalue())
待解决问题
如何在Jupyter Notebook中不经过本地存储,直接使用多个DataFrame在S3上生成多工作表Excel工作簿?如何复用单CSV直传的逻辑,实现多DataFrame写入Excel后直接上传S3?
解决方案
核心逻辑和单CSV直传一致,区别是Excel为二进制格式,需要使用内存二进制缓冲区BytesIO替代文本缓冲区StringIO,搭配openpyxl引擎支持内存写入,全程不会生成本地临时文件。
首先安装必要依赖:
pip install pandas boto3 openpyxl
完整实现代码:
import pandas as pd import boto3 from io import BytesIO # 构造测试DataFrame,可替换为你自己的实际数据 data1 = {'first_column': ['first_value','second_value'], 'second_column': ['first_value', 'second_value']} df1 = pd.DataFrame(data1) data2 = {'first_column': ['xvalue', 'yvalue'], 'second_column': ['xavalue', 'yavalue']} df2 = pd.DataFrame(data2) # 内存中写入多Sheet Excel buffer = BytesIO() with pd.ExcelWriter(buffer, engine='openpyxl') as writer: # 按需添加更多DataFrame即可,每个对应一个独立工作表 df1.to_excel(writer, sheet_name='df1', index=False) df2.to_excel(writer, sheet_name='df2', index=False) # 重置缓冲区指针到起始位置,避免上传空文件 buffer.seek(0) # 直传内存中的Excel文件到S3 s3_client = boto3.client('s3') bucket_name = "my_bucket_name" target_object_key = "final_fake.xlsx" s3_client.put_object( Bucket=bucket_name, Key=target_object_key, Body=buffer.getvalue() )
关键说明
- 禁止使用
StringIO存储Excel内容:Excel是二进制格式,使用文本缓冲区会触发编码错误,最终生成的文件无法正常打开 - 写入完成后必须调用
buffer.seek(0):ExcelWriter写入完成后,缓冲区指针默认停在内容末尾,不重置指针的话上传的文件会是0字节损坏状态 - 如果需要保留DataFrame的行索引,把
to_excel方法中的index=False改为index=True即可 - AWS权限配置和你之前上传CSV的要求完全一致,可以通过本地凭证文件、环境变量、Jupyter运行环境绑定的IAM角色等方式配置,不需要额外权限
内容的提问来源于stack exchange,提问作者Namra
相关产品推荐
相关产品推荐

