如何按多级列索引合并DataFrame?现有合并代码失效求助
解决多级列DataFrame合并问题
我来帮你搞定这个合并问题!首先得明确你的两个DataFrame的列是多级索引(MultiIndex),之前的代码出错是因为指定合并列的方式不对,下面给你两种可行的解决方案:
1. 直接使用merge并正确指定合并键
因为两个DataFrame的共同列名是同一个多级元组('A','a'),你可以直接用on参数指定这个列,而不是嵌套的元组写法。另外如果想保留df1的原有行顺序,记得加上sort=False:
import pandas as pd # 先构造你的数据(方便验证) df1 = pd.DataFrame([[0,3],[1,4],[2,5]], columns=pd.MultiIndex.from_tuples([('A','a'), ('B','b')])) df2 = pd.DataFrame([[2,6],[1,7],[0,8]], columns=pd.MultiIndex.from_tuples([('A','a'), ('C','c')])) # 正确的合并代码 df_merged = df1.merge(df2, on=('A','a'), how='inner', sort=False) print(df_merged)
执行后会得到:
(A, a) (B, b) (C, c) 0 0 3 8 1 1 4 7 2 2 5 6
为什么之前的代码不行?
你写的left_on=(('A','a'))其实等价于left_on=(('A','a'),)——这是一个嵌套元组,pandas会尝试查找名为这个嵌套元组的列,但你的实际列名是('A','a')这个普通元组,自然匹配不到,导致合并结果不符合预期。
2. 先将共同列设为索引,再用join合并
如果你更习惯用索引来合并数据,可以先把('A','a')列设置为两个DataFrame的索引,再用join方法合并,最后恢复索引为数据列:
# 将共同列设为索引 df1_indexed = df1.set_index(('A','a')) df2_indexed = df2.set_index(('A','a')) # 合并并恢复索引 df_merged = df1_indexed.join(df2_indexed).reset_index() print(df_merged)
这个方法也能得到和上面一致的结果,适合需要频繁基于索引操作的场景。
内容的提问来源于stack exchange,提问作者amarion
相关产品推荐
相关产品推荐

