You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用pandas批量清洗文件夹内多个数据文件并按原文件名保存

遍历处理批量tsv文件方案

你可以借助glob模块匹配目标命名的文件,再循环逐份处理即可,完整可运行代码如下:

import pandas as pd
import os
from glob import glob

# 替换为你存放数据文件的实际文件夹路径
data_dir = "./your_data_folder"

# 匹配所有admin开头的tsv文件,无文件后缀可将匹配规则改为 "admin*"
target_files = glob(os.path.join(data_dir, "admin*.tsv"))

for file_path in target_files:
    # 沿用你原有的单文件读取逻辑
    df = pd.read_csv(
        file_path,
        comment="#",
        header=None,
        sep="\t",
        names=["index", "count", "text", "tag"]
    )
    # 以原文件名覆盖保存,不额外输出pandas默认行号列
    df.to_csv(file_path, sep="\t", index=False)

注意事项

  • 运行前请替换data_dir为你的数据文件夹实际路径,若脚本直接在数据文件夹内运行,填./即可
  • 建议先备份所有原始文件再运行代码,避免误操作导致数据丢失
  • 如果需要保存为其他路径不覆盖原文件,修改to_csv的第一个参数为新路径即可

内容的提问来源于stack exchange,提问作者Eric

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.07 03:12:00