读取CSV后如何处理MultiIndex DataFrame中的无名列?
处理Pandas多表头CSV的Unnamed层级问题
原始CSV结构
,,companyName ,,2014_counts nationalClass,nationalClassTitle, 426,"Food or edible material: processes, compositions, and products",31 424,"Drug, bio-affecting and body treating compositions",25
当前读取代码
import glob import pandas as pd dfs = [] csv_files = glob.glob(path + "/*.csv") for file in csv_files: dfs.append(pd.read_csv(file, sep=',', header=[0,1,2], index_col=0))
问题现象
读取后列的MultiIndex出现大量Unnamed:前缀的无效层级,表头显示如下:
| nationalClass | Unnamed: 1_level_0 Unnamed: 1_level_1 nationalclassTitle | companyName 2014_counts Unnamed: 2_level_2 |
|---|---|---|
| 426 | Food or edible material: processes, compositio... | 31 |
| 424 | Drug, bio-affecting and body treating composit... | 25 |
期望效果
仅保留有效命名层级,空层级不显示:
| nationalClass | nationalclassTitle | companyName 2014_counts |
|---|---|---|
| 426 | Food or edible material: processes, compositio... | 31 |
| 424 | Drug, bio-affecting and body treating composit... | 25 |
解决方案(无需重建MultiIndex)
直接对已读取的DataFrame列索引进行批量替换,将所有Unnamed:开头的层级名改为空字符串:
for df in dfs: # 遍历MultiIndex的每个层级,替换Unnamed前缀的内容 new_levels = [] for level in df.columns.levels: new_level = level.str.replace(r'^Unnamed:.*$', '', regex=True) new_levels.append(new_level) df.columns = df.columns.set_levels(new_levels)
或者更简洁的写法,直接处理每个索引元组:
for df in dfs: df.columns = pd.MultiIndex.from_tuples( [tuple('' if 'Unnamed' in item else item for item in tup) for tup in df.columns] )
这两种方式都不需要手动重新构建整个MultiIndex,只是修改现有索引中的无效名称,处理后表头会自动显示为空的层级,符合期望效果。
内容的提问来源于stack exchange,提问作者sheth7
相关产品推荐
相关产品推荐

