调用list()统计csv行数后无法遍历csv文件问题咨询
csv.reader统计行数后无法遍历的问题原因与解决方案
问题产生原因
csv.reader返回的是迭代器对象,并非可重复遍历的序列结构。迭代器的核心特性是单次遍历生效,遍历过程中指针会持续向末尾移动,遍历完成后指针停在终点无法重置。你调用list(csv_file)时已经完整遍历了一次迭代器,将所有行数据读取并转为列表,此时迭代器指针已经处于文件末尾,后续再遍历该csv.reader对象时自然无法读取到任何数据。
解决方案
- 方案1:小文件场景直接将迭代器转成列表存储,后续行数统计、遍历操作都基于该列表执行,代码最简洁:
import csv with open(data, 'r') as f_csv: csv_rows = list(csv.reader(f_csv)) # 统计行数 print(len(csv_rows)) # 遍历数据 for row in csv_rows: print(row)
- 方案2:大文件场景不想一次性加载全量数据占内存的话,可以统计行数后将文件指针重置到开头,再重新生成reader对象遍历:
import csv with open(data, 'r') as f_csv: # 第一次遍历统计行数 csv_file = csv.reader(f_csv) row_count = len(list(csv_file)) print(row_count) # 将文件指针移回文档开头 f_csv.seek(0) # 重新生成reader对象遍历数据 csv_file_new = csv.reader(f_csv) for row in csv_file_new: print(row)
- 方案3:只遍历一次文件,同时完成行数统计和业务逻辑,执行效率最高:
import csv with open(data, 'r') as f_csv: csv_file = csv.reader(f_csv) row_count = 0 for row in csv_file: row_count += 1 # 原有遍历业务逻辑 print(row) # 输出统计行数 print(row_count)
内容的提问来源于stack exchange,提问作者fraxton
相关产品推荐
相关产品推荐

