You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas中基于条件匹配从另一个DataFrame更新列值

高效解决方案

针对百万级数据集,以下两种方法均能避免低效的全量合并,在速度和内存占用上表现优异:

方法1:使用DataFrame.update(推荐,简洁高效)

update方法会基于索引匹配直接更新原DataFrame的指定列,性能优于merge类操作。

# 复制原数据避免修改原始df_A(若允许直接修改可跳过此步)
df_A_updated = df_A.copy()

# 把df_B转换为以name_unique_identifier为索引的映射表,仅保留需要更新的列
df_b_mapper = df_B.set_index('name_unique_identifier')[['last_name', 'first_name']]

# 设置df_A的索引为匹配键,执行更新后恢复原索引
df_A_updated.set_index('name_unique_identifier', inplace=True)
df_A_updated.update(df_b_mapper)
df_A_updated.reset_index(inplace=True)

方法2:字典映射(极致性能,内存友好)

将df_B转换为字典后用map批量替换,适合超大规模数据集,内存占用更低。

# 构建姓氏和名字的映射字典
last_name_map = df_B.set_index('name_unique_identifier')['last_name'].to_dict()
first_name_map = df_B.set_index('name_unique_identifier')['first_name'].to_dict()

# 仅更新匹配到的条目,未匹配项保留原值
df_A['last_name'] = df_A['name_unique_identifier'].map(last_name_map).fillna(df_A['last_name'])
df_A['first_name'] = df_A['name_unique_identifier'].map(first_name_map).fillna(df_A['first_name'])

验证结果

更新后的df_A中,匹配组的列值已替换为df_B的标准值:

  • NAME_GROUP-11所有行:last_name=Henry,first_name=Williams
  • NAME_GROUP-13所有行:last_name=Smith,first_name=David
  • NAME_GROUP-14所有行:last_name=Freeman,first_name=Walter
  • 未匹配组(如NAME_GROUP-12、NAME_GROUP-15等)保持原始数据不变

内容的提问来源于stack exchange,提问作者myamulla_ciencia

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.24 21:06:23