DataFrame分组报错:'GL'既是索引层级又是列标签的解决问询
解决Pandas中'GL'既是索引层级又是列标签的歧义错误
这个报错我之前也踩过坑!本质是Pandas没法区分你在groupby里写的'GL'到底是指DataFrame的列名,还是索引里的某个层级——两者重名了,自然就抛出歧义错误。至于为什么删除2019年数据的代码会触发这个问题,大概率是删除行之后,索引的元数据状态发生了变化,让Pandas原本没察觉到的重名冲突显现出来了。
给你几个实用的解决方案,按需选就行:
方案1:重置索引,彻底消除冲突
最直接的办法就是在删除2019年数据后,重置一下索引,把原来的行索引去掉,这样就不会和GL列重名了:
# 删除2019年数据行 df.drop(df[df.month.str.contains('2019')].index, inplace=True) # 重置索引,丢弃原索引避免冲突 df.reset_index(drop=True, inplace=True) df.sort_values(by=['GL', 'month'], inplace=True) df["diffDebit"] = df.groupby('GL')['GL_Debit'].diff().fillna(df['GL_Debit']) df["diffCredit"] = df.groupby('GL')['GL_Credit'].diff().fillna(df['GL_Credit'])
方案2:明确指定分组依据是列(不用改索引)
如果你不想动索引,可以用pd.Grouper明确告诉Pandas你要按列GL分组,彻底打消它的疑虑:
# 删除2019年数据行 df.drop(df[df.month.str.contains('2019')].index, inplace=True) df.sort_values(by=['GL', 'month'], inplace=True) # 用pd.Grouper(key='GL')指定按列分组 df["diffDebit"] = df.groupby(pd.Grouper(key='GL'))['GL_Debit'].diff().fillna(df['GL_Debit']) df["diffCredit"] = df.groupby(pd.Grouper(key='GL'))['GL_Credit'].diff().fillna(df['GL_Credit'])
方案3:重命名索引层级(如果原索引有GL层级)
要是你的DataFrame本来就有一个叫'GL'的索引层级,那可以先把这个层级重命名,从根源上解决重名问题:
# 重命名索引里的GL层级(假设是多重索引) df.index = df.index.rename('GL_index', level='GL') # 然后正常执行后续操作 df.drop(df[df.month.str.contains('2019')].index, inplace=True) df.sort_values(by=['GL', 'month'], inplace=True) df["diffDebit"] = df.groupby('GL')['GL_Debit'].diff().fillna(df['GL_Debit']) df["diffCredit"] = df.groupby('GL')['GL_Credit'].diff().fillna(df['GL_Credit'])
至于为什么删掉删除2019年数据的代码就正常?大概率是未删除数据时,Pandas默认优先识别列名,而删除行后索引的状态变化让它开始检测到重名冲突,于是就报错了。
内容的提问来源于stack exchange,提问作者Philippe Haumesser
相关产品推荐
相关产品推荐

