You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何设置Pandas列类型优化内存 解决大文件读取内存报错

问题背景
  • 读取总大小2.71GB的CSV数据集时触发Memory Error、ParserError: Error tokenizing data. C error: out of memory报错,已尝试增大虚拟内存未解决
  • 原有实现为循环遍历数据集目录下的CSV文件,逐文件读入后通过DataFrame.append()拼接全量数据
  • 目标为通过合理设置Pandas列数据类型降低内存消耗,解决大文件读取时的内存溢出问题
优化方案

1. 先修正原有代码的无意义内存损耗

原有循环中逐次调用append的写法会在每次拼接时生成全新的DataFrame副本,峰值内存会达到实际数据量的2~3倍,是造成内存溢出的核心原因之一。直接将所有单文件读入的DataFrame存入列表,最后一次性调用pd.concat完成拼接,可直接削减一半以上的冗余内存占用。

2. 提前指定列数据类型,从读取阶段压缩内存

Pandas默认读取CSV时会用64位整数、64位浮点数、object字符串类型存储所有列,内存浪费极其严重,通过匹配最小可用类型通常能把内存占用压缩到原有的1/3~1/10,2.71GB的数据集优化后仅需数百MB内存即可正常加载,步骤如下:

  • 第一步:抽样读取小部分数据识别列特征,不需要全量加载。取目录下任意一个CSV文件,仅读取前1000行作为样本即可:
import pandas as pd
import pathlib

base_path = pathlib.Path('dataset')
# 取目录下第一个文件作为抽样样本
sample_file = next(base_path.iterdir())
sample_df = pd.read_csv(sample_file, nrows=1000)
  • 第二步:基于样本自动生成最优类型映射字典:
    • 整数列:根据列的取值范围自动匹配最小位宽的整数类型,无负数的列优先用无符号整数类型
    • 浮点列:自动向下压缩为最小位宽的浮点类型,不需要默认使用float64
    • 低基数字符串列(唯一值占比低于50%,比如房源类型、城市名、行政区名这类枚举值),直接指定为category分类类型,内存占用仅为原字符串存储的1/10甚至更低
    • 明确不需要的列直接加入黑名单,读取时跳过,从源头减少加载数据量
      对应实现代码:
dtype_dict = {}
for col in sample_df.columns:
    col_series = sample_df[col]
    # 处理数值类型列
    if pd.api.types.is_numeric_dtype(col_series):
        if pd.api.types.is_integer_dtype(col_series):
            # 整数列自动匹配最小类型
            if col_series.min() >= 0:
                dtype_dict[col] = pd.to_numeric(col_series, downcast='unsigned').dtype
            else:
                dtype_dict[col] = pd.to_numeric(col_series, downcast='integer').dtype
        else:
            # 浮点列自动匹配最小类型
            dtype_dict[col] = pd.to_numeric(col_series, downcast='float').dtype
    # 处理对象/字符串类型列
    else:
        unique_count = col_series.nunique()
        # 低基数列转分类类型
        if unique_count / len(sample_df) < 0.5:
            dtype_dict[col] = 'category'
  • 第三步:传入类型映射字典读取所有文件,一次性完成拼接:
df_list = []
for file in base_path.iterdir():
    temp_df = pd.read_csv(
        file,
        dtype=dtype_dict,
        # 存在日期列时放开下方注释,指定日期列自动解析,不要存为字符串
        # parse_dates=['host_since', 'last_review'],
        low_memory=False
    )
    df_list.append(temp_df)

# 一次性合并全量数据
base_airbnb = pd.concat(df_list, ignore_index=True)

3. 极端场景兜底优化

如果完成上述优化后仍存在内存峰值过高的问题,可在read_csv中传入chunksize=10000参数按1万行每块分块读取文件,每块读取完成后单独做类型压缩再存入拼接列表,可进一步将读取峰值内存降低70%以上。

注意:抽样生成类型字典时需确认样本取值覆盖全量数据的取值范围,若某列全量数据存在超出样本取值范围的数值触发类型溢出,手动将对应列的类型调大一位即可,比如从int16调整为int32。


内容的提问来源于stack exchange,提问作者Jhon Oliver

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.28 06:54:08