You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas扩展多级列结构时如何清除生成的NaN值

问题原因

你当前的替换逻辑仅处理了拆分后得到的显式空字符串,但未处理元组长度不一致导致Pandas自动补全的NaN:

  • 带_的二级列名拆分后会生成2个值,对应元组长度为3(一级列名+2个拆分结果)
  • etc、mtc的二级列名是空,拆分后仅得到1个空字符串,对应元组长度为2(一级列名+1个拆分结果)
  • 构造MultiIndex时,Pandas会自动给长度不足的元组末尾补NaN,这部分值未被你的替换逻辑覆盖,因此会显示空值。

修复方案

先计算所有拆分后元组的最大长度,将所有元组统一补全到最大长度,空缺位置用_填充即可,修改后代码如下:

import pandas as pd
import numpy as np
import re
np.random.seed(0)


arrays = [["tech_one", "tech_one", "tech_one", "tech_one", "tech_two", "tech_two", "tech_two",
           "tech_two",'tech_three','tech_three','tech_four','etc','mtc'],
          ["ch0_b0", "ch1_b0", "ch2_b0", "ch3_b0", "ch0", "ch1", "ch2", "ch3","ch1",'ch3','ch5','','']]

index = pd.MultiIndex.from_tuples(list(zip(*arrays)), names=["first", "second"])
df = pd.DataFrame(np.random.randn(3, len(arrays[0])), columns=index)
tup = [(e[0], *re.split('_', e[1])) for e in df.columns]
# 计算所有拆分后元组的最大长度
max_len = max(len(t) for t in tup)
# 统一替换空字符串+补全元组长度到最大值,空缺位置填_
pad_tup = [tuple(x if x != '' else '_' for x in t) + ('_',) * (max_len - len(t)) for t in tup]

df.columns = pd.MultiIndex.from_tuples(pad_tup)

运行后输出的多级列就会符合预期,不会再出现空值。

内容的提问来源于stack exchange,提问作者rpb

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 09:21:01