You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

从CSV文件列表创建对应命名DataFrame及报错处理方案

现有实现的优化点

  • 避免修改全局工作目录:os.chdir会修改进程的全局工作路径,后续其他路径操作容易出问题。直接在glob匹配时传入完整路径即可,更安全。
  • 更可靠的文件名提取:用os.path.splitext()或者pathlib的stem属性获取无后缀文件名,替代手动切片[:-4],避免遇到带多个点的文件名(如data.v2.csv)时提取错误。
  • 简化中间变量:不需要单独生成csv_names列表再zip,直接在遍历csv文件的循环中处理文件名即可,减少冗余代码。
  • 增加异常捕获:单个文件读取失败不会中断整个流程,同时输出错误文件信息,方便排查问题。
  • 按需优化读取性能:low_memory=False虽然解决了列类型推断的警告,但大文件场景下会增加内存开销,可通过dtype参数提前指定列类型,既提升读取速度也降低内存占用。

优化后的参考代码:

import pandas as pd
from pathlib import Path

DATA_DIR = Path("./Data/")
df_collection = {}

for csv_path in DATA_DIR.glob("*.csv"):
    try:
        # stem属性自动获取不带后缀的文件名,兼容各种后缀命名场景
        df_name = csv_path.stem
        df_collection[df_name] = pd.read_csv(
            csv_path,
            low_memory=False
        )
    except Exception as e:
        print(f"文件{csv_path.name}读取失败:{str(e)}")

CSV字段数不一致的处理方案

  • 轻度容错不中断:pandas 1.4及以上版本可给pd.read_csv增加on_bad_lines="warn"参数,遇到字段数不匹配的行时输出告警信息,直接跳过坏行继续读取;如果不需要告警可改为on_bad_lines="skip"。
  • 自动补全列对齐:如果需要保留所有行的内容,可先读取文件的表头作为固定列名,读取时传入names参数指定列,多余字段会被丢弃,缺失字段自动补NaN,不会触发解析错误:
    with open(csv_path, "r", encoding="utf-8") as f:
        # 读取第一行作为标准表头
        headers = f.readline().strip().split(",")
    df = pd.read_csv(
        csv_path,
        names=headers,
        header=0,  # 跳过原表头行,避免重复读取
        on_bad_lines="skip"
    )
    
  • 预处理校验数据:对数据质量要求高的场景,可先用csv模块遍历文件每行,提前把字段数不匹配的行存入单独的错误日志文件,再读取校验后的正常数据,避免脏数据影响后续分析。
  • 换解析引擎兼容:如果C引擎解析频繁出错,可添加engine="python"参数,Python解析引擎的容错性更高,只是大文件读取速度会慢一些。

内容的提问来源于stack exchange,提问作者Matan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.23 16:15:05