You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何高效内存加载多个CSV至单个Pandas DataFrame?

解决大型CSV文件迭代构建Pandas DataFrame的方案

针对内存仅能容纳一份完整数据、无法用pd.concat一次性加载所有文件的场景,以下几种迭代构建方案可以解决问题:

1. 逐文件加载并增量合并

无需一次性加载所有CSV,逐个加载单个文件后追加到主DataFrame,内存中始终只保留主DataFrame和当前单个文件的临时数据:

import pandas as pd
import glob

# 获取目标路径下所有CSV文件
csv_paths = glob.glob("/path/to/your/csvs/*.csv")

# 初始化空DataFrame
combined_df = pd.DataFrame()

for path in csv_paths:
    # 加载单个CSV文件
    temp_df = pd.read_csv(path)
    # 增量合并到主DataFrame
    combined_df = pd.concat([combined_df, temp_df], ignore_index=True)
    # 手动释放临时数据内存
    del temp_df

额外优化:如果不需要所有列,可通过usecols参数指定加载列,进一步降低内存占用。

2. 分块读取超大CSV并迭代合并

若单个CSV文件也超出内存容量,可以结合分块读取功能,逐块合并:

import pandas as pd
import glob

csv_paths = glob.glob("/path/to/your/csvs/*.csv")
combined_df = pd.DataFrame()

for path in csv_paths:
    # 按指定块大小读取CSV,chunksize根据内存调整
    for chunk in pd.read_csv(path, chunksize=10000):
        combined_df = pd.concat([combined_df, chunk], ignore_index=True)
        del chunk

3. 用Dask过渡后转Pandas DataFrame

Dask支持延迟计算和分块处理超大数据集,先将所有CSV加载为Dask DataFrame,最终再合并为Pandas DataFrame(前提是合并后的完整数据能放入内存):

import dask.dataframe as dd

# 批量加载所有CSV为Dask DataFrame(延迟计算,不占内存)
dask_df = dd.read_csv("/path/to/your/csvs/*.csv")
# 执行计算并转为Pandas DataFrame
combined_df = dask_df.compute()

4. 借助SQLite中间存储

将每个CSV写入SQLite数据库,最后一次性读取合并结果,避免内存同时加载多个文件:

import pandas as pd
import glob
import sqlite3

# 连接SQLite数据库(可选择内存模式或文件模式)
conn = sqlite3.connect("temp_combined.db")

csv_paths = glob.glob("/path/to/your/csvs/*.csv")
for path in csv_paths:
    temp_df = pd.read_csv(path)
    # 追加写入数据库表
    temp_df.to_sql("combined_data", conn, if_exists="append", index=False)
    del temp_df

# 从数据库读取完整合并数据
combined_df = pd.read_sql("SELECT * FROM combined_data", conn)
conn.close()

内容的提问来源于stack exchange,提问作者kjanko

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.19 20:50:25