Python使用ZipFile读取压缩包报不存在dataset.csv的KeyError如何解决
DataProcesser类KeyError异常排查
问题场景
我在开发数据处理程序时定义了DataProcesser类,核心处理流程如下:
- 首先在
raw_file_processing函数中完成原始数据格式化处理 - 接着调用
dataset_csv函数生成dataset.csv文件 - 最后通过
zip_files函数对目标文件进行压缩
实例化DataProcesser类时,默认开启的read_on_init参数会自动触发read_archive方法读取压缩包内的dataset.csv文件,此时程序抛出KeyError异常:
KeyError: "There is no item named 'dataset.csv' in the archive"
根因定位方向
按以下优先级排查即可定位问题:
- 压缩逻辑校验:打印
zip_files函数的输入文件列表,确认dataset.csv是否被纳入压缩范围,同时检查压缩时是否给文件加了目录前缀,比如压缩包内的文件路径为output/dataset.csv,直接按根路径下的dataset.csv读取就会报错 - 文件名一致性校验:检查
dataset_csv生成的实际文件名是否和读取时的文件名完全一致,包括大小写、拼写、后缀,Windows系统本地文件名不区分大小写,但zip压缩包内的路径是大小写敏感的 - IO操作时序校验:确认生成
dataset.csv后已经关闭文件句柄,再执行压缩操作,避免文件未完全落盘就被压缩,导致压缩包内无有效文件 - 压缩包路径校验:打印
read_archive方法读取的压缩包绝对路径,确认读取的是本次流程新生成的压缩包,而非历史遗留的无dataset.csv的旧包
临时验证方案
如果需要快速验证业务逻辑,可以在read_archive方法读取文件前,先打印压缩包内的所有文件名列表,确认目标文件的实际名称,示例代码如下:
# 以Python标准库zipfile为例 import zipfile import pandas as pd with zipfile.ZipFile(archive_path, 'r') as zf: # 打印压缩包内所有文件路径 print("压缩包内文件列表:", zf.namelist()) # 模糊匹配目标csv文件 target_file = [f for f in zf.namelist() if f.endswith('dataset.csv')][0] df = pd.read_csv(zf.open(target_file))
内容的提问来源于stack exchange,提问作者melololo
相关产品推荐
相关产品推荐

