You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python将含5000列的Excel文件拆分为5000个独立文件?

用Python拆分Excel多列为单个文件的实现方案

依赖准备

首先确保安装处理Excel所需的库:

pip install pandas openpyxl

核心实现代码

以下代码会读取目标Excel文件,将每一列单独保存为一个文件(默认用CSV格式,更适配神经网络训练场景,也可改为XLSX):

import pandas as pd

# 读取目标Excel文件,sheet_name可指定具体工作表名或索引
df = pd.read_excel('your_database.xlsx', sheet_name=0, engine='openpyxl')

# 遍历所有列,逐个保存
for col_name in df.columns:
    # 提取当前列数据(保持DataFrame格式,避免丢失表头)
    col_df = df[[col_name]]
    
    # 处理列名中的非法字符(防止文件名报错)
    safe_col_name = col_name.replace('/', '_').replace('\\', '_').replace(':', '_')
    
    # 保存为CSV文件(体积小、加载快,适合训练数据)
    col_df.to_csv(f'{safe_col_name}.csv', index=False)
    
    # 若需保存为XLSX格式,替换为下面的代码
    # col_df.to_excel(f'{safe_col_name}.xlsx', index=False, engine='openpyxl')

关键注意事项

  • 大文件优化:如果Excel文件行数极多(如百万级),可使用pd.read_excel的chunksize参数分块读取,避免内存溢出。
  • 文件名合法性:列名若包含/、\、:等操作系统不允许的字符,必须提前替换,否则会导致保存失败。
  • 格式选择:CSV格式更适合神经网络训练,多数数据加载库(如TensorFlow、PyTorch配套工具)能高效读取,且文件体积远小于XLSX。

内容的提问来源于stack exchange,提问作者Luckie One

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.09 10:10:19