You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何基于单个键高效合并含重复列的Pandas DataFrame

问题描述

我有两个DataFrame:

# df1 结构
df1 = 
K  C1 C2 C3 ... Cn D1 D2 D3
k1 1  2  4      7  1  2  3
k2 3  5  6      1  2  3  4

# df2 结构
df2 = 
K  C1 C2 C3 ... Cn B1 P1
k1 1  2  4      7  0  0
k1 1  2  4      7  0  1
k1 1  2  4      7  1  0
k1 1  2  4      7  1  1
k2 3  5  6      1  0  0
k2 3  5  6      1  0  1
k2 3  5  6      1  1  0
k2 3  5  6      1  1  1

期望合并后得到如下结果:

df_merged = 
K  C1 C2 C3 ... Cn B1 P1 D1 D2 D3
k1 1  2  4      7  0  0  1  2  3  
k1 1  2  4      7  0  1  1  2  3  
k1 1  2  4      7  1  0  1  2  3  
k1 1  2  4      7  1  1  1  2  3  
k2 3  5  6      1  0  0  2  3  4 
k2 3  5  6      1  0  1  2  3  4
k2 3  5  6      1  1  0  2  3  4
k2 3  5  6      1  1  1  2  3  4

由于基于[K....Cn]多列做左连接的性能开销过大,不想采用该方式,求最优实现方法。

最优实现方法

核心思路是通过单整数键替代多列连接键,大幅降低连接的计算开销,具体步骤如下:

  1. 给df1添加整数类型的分组标识列group_id,每个K对应唯一的整数id:
df1['group_id'] = df1['K'].factorize()[0]
  1. 给df2映射相同的group_id,利用K和df1的对应关系生成:
# 构建K到group_id的映射字典
k_id_map = df1.set_index('K')['group_id'].to_dict()
df2['group_id'] = df2['K'].map(k_id_map)
  1. 仅通过group_id做左连接,最后清理临时列:
# 合并时去掉df1中重复的K、C1-Cn列,避免冗余
merge_cols = df1.columns.difference(['K', 'C1', 'C2', 'C3', 'Cn'])
df_merged = df2.merge(df1[merge_cols], on='group_id', how='left').drop(columns='group_id')

性能优势说明

  • 整数类型的group_id做连接键时,哈希计算和数据比对的效率远高于多列(尤其是包含字符串的K列),能显著提升连接速度。
  • 避免了多列连接时的大量数据校验操作,内存占用更低,适合处理大规模数据集。

如果K本身是唯一分组标识且为整数类型,也可以直接用K做连接键,但字符串类型的K建议先转成整数id再连接,性能提升更明显。

内容的提问来源于stack exchange,提问作者Cranjis

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.22 18:54:39