Pandas如何按索引匹配将列值子集替换为另一DataFrame的列值
pandas按索引匹配批量替换列值方案
问题场景
- 原始表
df包含a、b两列,示例数据:
a b 0 6 4 1 5 6 2 2 2 3 7 4 4 3 6 5 5 2 6 4 7
- 替换值表
df2仅含d列,所有索引均为df中已存在的共有索引,无额外索引,示例数据:
d 0 60 1 50 5 50 6 40
需求为:仅对两表共有的索引行,将df对应行的a列值替换为df2的d列值,其余行数据保持不变,最终输出结果如下,要求实现效率高于逐行遍历:
a b 0 60 4 1 50 6 2 2 2 3 7 4 4 3 6 5 50 2 6 40 7
实现方法
直接用pandas原生的索引对齐机制做标签定位赋值即可,全程为向量化运算,性能远高于逐行循环:
# 核心替换代码 df.loc[df2.index, 'a'] = df2['d']
如果后续遇到df2可能包含df不存在的索引的场景,先取索引交集再赋值,避免触发键错误:
# 兼容扩展写法 common_idx = df.index.intersection(df2.index) df.loc[common_idx, 'a'] = df2.loc[common_idx, 'd']
原理说明
df.loc[df2.index, 'a']会精准选中df中所有待替换的目标行与目标列,不会改动其余位置的数据- 赋值时pandas会自动按索引匹配对应值,不需要手动编写循环或匹配逻辑
- 所有运算均在pandas底层C级实现的向量化逻辑中执行,数据量越大,性能优势越明显
小提示:如果替换后需要保留原始
df的数据,先执行df_new = df.copy()再对df_new做赋值操作即可,不会修改原表。
内容的提问来源于stack exchange,提问作者nogmos
相关产品推荐
相关产品推荐

