You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python使用ZipFile读取压缩包报不存在dataset.csv的KeyError如何解决

DataProcesser类KeyError异常排查

问题场景

我在开发数据处理程序时定义了DataProcesser类,核心处理流程如下:

  • 首先在raw_file_processing函数中完成原始数据格式化处理
  • 接着调用dataset_csv函数生成dataset.csv文件
  • 最后通过zip_files函数对目标文件进行压缩

实例化DataProcesser类时,默认开启的read_on_init参数会自动触发read_archive方法读取压缩包内的dataset.csv文件,此时程序抛出KeyError异常:

KeyError: "There is no item named 'dataset.csv' in the archive"

根因定位方向

按以下优先级排查即可定位问题:

  1. 压缩逻辑校验:打印zip_files函数的输入文件列表,确认dataset.csv是否被纳入压缩范围,同时检查压缩时是否给文件加了目录前缀,比如压缩包内的文件路径为output/dataset.csv,直接按根路径下的dataset.csv读取就会报错
  2. 文件名一致性校验:检查dataset_csv生成的实际文件名是否和读取时的文件名完全一致,包括大小写、拼写、后缀,Windows系统本地文件名不区分大小写,但zip压缩包内的路径是大小写敏感的
  3. IO操作时序校验:确认生成dataset.csv后已经关闭文件句柄,再执行压缩操作,避免文件未完全落盘就被压缩,导致压缩包内无有效文件
  4. 压缩包路径校验:打印read_archive方法读取的压缩包绝对路径,确认读取的是本次流程新生成的压缩包,而非历史遗留的无dataset.csv的旧包

临时验证方案

如果需要快速验证业务逻辑,可以在read_archive方法读取文件前,先打印压缩包内的所有文件名列表,确认目标文件的实际名称,示例代码如下:

# 以Python标准库zipfile为例
import zipfile
import pandas as pd

with zipfile.ZipFile(archive_path, 'r') as zf:
    # 打印压缩包内所有文件路径
    print("压缩包内文件列表:", zf.namelist())
    # 模糊匹配目标csv文件
    target_file = [f for f in zf.namelist() if f.endswith('dataset.csv')][0]
    df = pd.read_csv(zf.open(target_file))

内容的提问来源于stack exchange,提问作者melololo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 01:54:03