基于多列合并DataFrame并对左右index列去重的问题
问题分析与解决方案
你的问题出在同时对index_x和index_y做全局去重的逻辑上:当前的~mp['index_x'].duplicated() & ~mp['index_y'].duplicated()会只保留第一个既不重复x也不重复y的行,但这种方式会浪费很多可配对的组合——比如存在x1-y1、x1-y2、x2-y1的匹配时,该逻辑只会保留x1-y1,而实际上我们可以得到x1-y2和x2-y1两个有效匹配对。
要实现每个index_x仅匹配一次、每个index_y仅匹配一次的最大匹配效果,推荐以下两种方案:
方案1:基于分组序号的轻量实现(适合中小数据量)
先筛选目标条件的子集,再给每个index_x和index_y的出现顺序编号,最后保留序号一致的配对,确保每个x/y只在对应序号中出现一次:
# 1. 先筛选出目标条件的子集 target_subset = mp[(mp['male'] == 1) & (mp['age_cat'] == 0) & (mp['inpatient'] == 0)] # 2. 给每个index_x的匹配记录分配顺序号 target_subset['x_seq'] = target_subset.groupby('index_x').cumcount() # 给每个index_y的匹配记录分配顺序号 target_subset['y_seq'] = target_subset.groupby('index_y').cumcount() # 3. 保留序号一致的行,得到最大唯一匹配对 final_result = target_subset[target_subset['x_seq'] == target_subset['y_seq']]
方案2:二分图最大匹配(适合大数据量/复杂场景)
如果数据量极大或匹配逻辑更复杂,可以用二分图最大匹配算法,确保找到最多的有效配对:
import networkx as nx from networkx.algorithms import bipartite # 1. 筛选目标子集 target_subset = mp[(mp['male'] == 1) & (mp['age_cat'] == 0) & (mp['inpatient'] == 0)] # 2. 构建二分图:左侧是index_x,右侧是index_y graph = nx.Graph() graph.add_nodes_from(target_subset['index_x'].unique(), bipartite=0) graph.add_nodes_from(target_subset['index_y'].unique(), bipartite=1) # 添加所有匹配边 graph.add_edges_from(target_subset[['index_x', 'index_y']].values.tolist()) # 3. 计算最大匹配 max_matching = bipartite.maximum_matching(graph) # 4. 筛选出匹配成功的行 # 注意:max_matching是双向字典,需要过滤出x->y的配对 valid_pairs = set() for x, y in max_matching.items(): if x in target_subset['index_x'].unique(): valid_pairs.add((x, y)) final_result = target_subset[target_subset.apply(lambda row: (row['index_x'], row['index_y']) in valid_pairs, axis=1)]
为什么原方法失效?
举个简单例子:假设目标子集有3行数据:
| index_x | index_y | male | age_cat | inpatient |
|---|---|---|---|---|
| x1 | y1 | 1 | 0 | 0 |
| x1 | y2 | 1 | 0 | 0 |
| x2 | y1 | 1 | 0 | 0 |
原方法~duplicated()会只保留第一行(x1和y1都是首次出现),但实际我们可以得到x1-y2、x2-y1两个有效配对,这正是方案1和2能解决的问题。
内容的提问来源于stack exchange,提问作者horcle_buzz
相关产品推荐
相关产品推荐

