Pandas用reindex扩展多层DataFrame时NaN问题及代码简化问询
多层索引层级扩展问题解决
问题背景
需要为现有3层索引的DataFrame扩展层级,将第一层索引中双下划线__前后的内容拆分,进一步拆分__前的单下划线分隔内容,实现索引层级加深。现有原始DataFrame结构如下:
col1 col2 mylevelA_caseA__VAR_A bar one -1.012046 0.808332 mylevelA_caseA__VAR_B bar two -0.558629 -0.358550 mylevelA_caseB__VAR_A baz one 1.514448 -1.045073 mylevelA_caseB__VAR_B baz two 1.268511 -1.100705 mylevelB_caseC__VAR_C foo one -2.108172 -1.694602 mylevelB_caseC__VAR_C_D foo two -0.629493 -0.005071 mylevelB_caseC__VAR_E qux one 0.596771 -0.964429 mylevelB_caseD__VAR_A qux two 0.257154 -0.248278
原有代码运行后出现col1、col2全为NaN的问题,同时循环逻辑冗余需要优化。
问题原因
全为NaN的核心原因是错误使用了reindex方法:reindex会用新生成的索引去匹配原有DataFrame的索引,新索引和原有索引的层级、取值完全不匹配,没有匹配到的行就会填充NaN,正确做法是直接为DataFrame的index属性赋值新的多层索引。
优化后实现代码
import pandas as pd import numpy as np # 初始化原始DataFrame arrays = [["mylevelA_caseA__VAR_A", "mylevelA_caseA__VAR_B", "mylevelA_caseB__VAR_A", "mylevelA_caseB__VAR_B", "mylevelB_caseC__VAR_C", "mylevelB_caseC__VAR_C_D", "mylevelB_caseC__VAR_E", "mylevelB_caseD__VAR_A"], ["bar", "bar", "baz", "baz", "foo", "foo", "qux", "qux"], ["one", "two", "one", "two", "one", "two", "one", "two"]] df = pd.DataFrame(np.random.randn(8, 2), index=arrays, columns=['col1','col2']) # 生成新的多层索引,仅用一行列表推导式完成拆分 new_index = [ (*s.split('__')[0].split('_'), s.split('__')[1], level2, level3) for s, level2, level3 in df.index ] # 直接替换原有索引,不需要reindex df.index = pd.MultiIndex.from_tuples(new_index) print(df)
优化点说明
- 索引拆分逻辑简化:利用双下划线
__作为明确分隔符直接拆分VAR前缀和后缀,再拆分前缀的单下划线即可得到需要的新增层级,不需要冗余的循环判断 - 避免NaN问题:直接给
df.index赋值新的MultiIndex,行顺序和原有数据完全对应,不会出现匹配失败的空值 - 代码精简:用列表推导式替代多层嵌套循环,代码可读性大幅提升
内容的提问来源于stack exchange,提问作者rpb
相关产品推荐
相关产品推荐

