如何使用pandas批量清洗文件夹内多个数据文件并按原文件名保存
遍历处理批量tsv文件方案
你可以借助glob模块匹配目标命名的文件,再循环逐份处理即可,完整可运行代码如下:
import pandas as pd import os from glob import glob # 替换为你存放数据文件的实际文件夹路径 data_dir = "./your_data_folder" # 匹配所有admin开头的tsv文件,无文件后缀可将匹配规则改为 "admin*" target_files = glob(os.path.join(data_dir, "admin*.tsv")) for file_path in target_files: # 沿用你原有的单文件读取逻辑 df = pd.read_csv( file_path, comment="#", header=None, sep="\t", names=["index", "count", "text", "tag"] ) # 以原文件名覆盖保存,不额外输出pandas默认行号列 df.to_csv(file_path, sep="\t", index=False)
注意事项
- 运行前请替换
data_dir为你的数据文件夹实际路径,若脚本直接在数据文件夹内运行,填./即可 - 建议先备份所有原始文件再运行代码,避免误操作导致数据丢失
- 如果需要保存为其他路径不覆盖原文件,修改
to_csv的第一个参数为新路径即可
内容的提问来源于stack exchange,提问作者Eric
相关产品推荐
相关产品推荐

