You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用glob读取多文件时DataFrame出现列重复问题求助

解决合并TXT文件到DataFrame时的部分列重复问题

我之前处理批量文本文件合并时也碰到过一模一样的问题!这种部分列重复的情况,十有八九是因为你要合并的TXT文件里,列名存在格式不一致的情况——比如有的列名是大写(UserID)、有的是小写(userid),或者有的列名带首尾空格(user_id)、有的中间是空格不是下划线(user id),Pandas会把这些当成完全不同的列,合并后自然就出现了"重复列"。

下面给你两种针对性的解决思路,从根源和事后处理两个层面搞定:

一、从读取环节统一列名(推荐)

最稳妥的方式是在读取每个文件时就标准化列名,让所有文件的列名格式完全一致,从根源避免列被误判为不同列。修改你的代码如下:

import pandas as pd
import glob
import functools

def read_clean_txt(file_path):
    # 读取单个TXT文件
    df = pd.read_csv(file_path, sep='\t', low_memory=False)
    # 标准化列名:去首尾空格→转小写→替换空格为下划线
    df.columns = df.columns.str.strip().str.lower().str.replace(' ', '_')
    return df

# 批量读取并合并所有文件,同时重置索引避免重复
merged_df = pd.concat(
    map(read_clean_txt, glob.glob(r'/folder/*.txt')),
    sort=False,
    ignore_index=True
)

这个方法的核心是read_clean_txt函数里的列名处理:

  • str.strip():去掉列名首尾的空格(很多时候手动编辑的文件会不小心加空格)
  • str.lower():统一转小写,消除大小写差异
  • str.replace(' ', '_'):把列名里的空格换成下划线,避免"user id"和"user_id"被当成不同列

二、合并后去除重复列(兜底方案)

如果已经合并完发现有重复列,或者确认源文件里确实存在同名列需要去重,可以用下面的代码快速去除重复列,保留每列第一次出现的版本:

# 保留每个列名第一次出现的列,删除后续重复的列
merged_df = merged_df.loc[:, ~merged_df.columns.duplicated()]

这里的~merged_df.columns.duplicated()会生成一个布尔数组,标记出每个列名首次出现的位置,用它来筛选DataFrame的列,就能一键去掉重复列。

额外提醒

如果用了上面的方法还是有问题,建议先抽查几个TXT文件的列名,看看是不是有其他特殊字符(比如制表符、换行符)导致的列名不一致——可以用print(df.columns)查看某个文件的列名,排查具体差异。

内容的提问来源于stack exchange,提问作者Nazan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.14 08:41:55