You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从Jupyter Notebook直接上传多Sheet Excel工作簿到Amazon S3

目标

在Jupyter Notebook中使用Python Pandas创建了多个不同的DataFrame,希望将它们作为独立工作表存入Excel工作簿,直接上传至Amazon S3,无需在本地存储中间文件。

现有可复现代码

本地存储中转的实现方式

## 构造两个测试DataFrame
data1 = {'first_column':  ['first_value','second_value'],
        'second_column': ['first_value', 'second_value']}
df1 = pd.DataFrame(data1)

data2 = {'first_column':  ['xvalue', 'yvalue'],
        'second_column': ['xavalue', 'yavalue']}
df2 = pd.DataFrame(data2)

## 将多个DataFrame写入本地Excel文件
with pd.ExcelWriter('fake_file.xlsx') as writer:  
    df1.to_excel(writer, sheet_name='df1')
    df2.to_excel(writer, sheet_name='df2')

## 上传本地Excel文件到S3
import boto3
import pathlib
import os

s3 = boto3.client("s3")
bucket_name = "my_bucket_name"
object_name = "final_fake.xlsx"
__file__ = "my_python_script.ipynb"
file_name = os.path.join(pathlib.Path(__file__).parent.resolve(), "fake_file.xlsx")

s3.upload_file(file_name, bucket_name, object_name)

已实现的单文件直传逻辑

目前已经可以实现单个DataFrame以CSV格式直接上传到S3,代码如下:

## 单个DataFrame以CSV格式直传S3
from io import StringIO 
import boto3

bucket = "my_bucket_name"
csv_buffer = StringIO()
df1.to_csv(csv_buffer)

s3_resource = boto3.resource('s3')
s3_resource.Object(bucket, 'df1.csv').put(Body=csv_buffer.getvalue())
待解决问题

如何在Jupyter Notebook中不经过本地存储,直接使用多个DataFrame在S3上生成多工作表Excel工作簿?如何复用单CSV直传的逻辑,实现多DataFrame写入Excel后直接上传S3?


解决方案

核心逻辑和单CSV直传一致,区别是Excel为二进制格式,需要使用内存二进制缓冲区BytesIO替代文本缓冲区StringIO,搭配openpyxl引擎支持内存写入,全程不会生成本地临时文件。

首先安装必要依赖:

pip install pandas boto3 openpyxl

完整实现代码:

import pandas as pd
import boto3
from io import BytesIO

# 构造测试DataFrame,可替换为你自己的实际数据
data1 = {'first_column':  ['first_value','second_value'],
        'second_column': ['first_value', 'second_value']}
df1 = pd.DataFrame(data1)

data2 = {'first_column':  ['xvalue', 'yvalue'],
        'second_column': ['xavalue', 'yavalue']}
df2 = pd.DataFrame(data2)

# 内存中写入多Sheet Excel
buffer = BytesIO()
with pd.ExcelWriter(buffer, engine='openpyxl') as writer:
    # 按需添加更多DataFrame即可,每个对应一个独立工作表
    df1.to_excel(writer, sheet_name='df1', index=False)
    df2.to_excel(writer, sheet_name='df2', index=False)
# 重置缓冲区指针到起始位置,避免上传空文件
buffer.seek(0)

# 直传内存中的Excel文件到S3
s3_client = boto3.client('s3')
bucket_name = "my_bucket_name"
target_object_key = "final_fake.xlsx"
s3_client.put_object(
    Bucket=bucket_name,
    Key=target_object_key,
    Body=buffer.getvalue()
)

关键说明

  • 禁止使用StringIO存储Excel内容:Excel是二进制格式,使用文本缓冲区会触发编码错误,最终生成的文件无法正常打开
  • 写入完成后必须调用buffer.seek(0):ExcelWriter写入完成后,缓冲区指针默认停在内容末尾,不重置指针的话上传的文件会是0字节损坏状态
  • 如果需要保留DataFrame的行索引,把to_excel方法中的index=False改为index=True即可
  • AWS权限配置和你之前上传CSV的要求完全一致,可以通过本地凭证文件、环境变量、Jupyter运行环境绑定的IAM角色等方式配置,不需要额外权限

内容的提问来源于stack exchange,提问作者Namra

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 11:06:16