You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Pandas的map实现多对一映射替代merge且保留原数据行?

解决方案:将key_df的location列匹配到data_df

针对你的需求,结合给出的示例数据,这里提供两种可行的修正方案:

方法1:优化Merge操作

你提到Merge后记录数增多,大概率是因为两个DataFrame都包含company列,若未明确指定该列参与合并,当数据中存在同一person_id对应不同company的情况时,会生成笛卡尔积。不过在你的示例数据中不存在这种问题,我们可以通过只选取key_df中必要的列来避免多余列生成,同时保证记录数与原data_df一致:

# 仅选取key_df中用于匹配和需要附加的列
merged_df = data_df.merge(
    key_df[['p_id', 'location']],
    left_on='person_id',
    right_on='p_id',
    how='left'
).drop(columns='p_id')  # 移除多余的p_id列

执行后得到的结果就包含你需要的person_id、company、dept_access、location四列,且记录数与原data_df完全相同。

方法2:修复Map方法

你编写的Map代码在示例数据中其实是可以正常生效的,执行后会为data_df新增location列,其中ace@gmail.com因在key_df中无匹配项会显示NaN。如果你的实际代码未生效,建议检查以下两点:

  • 确认data_df['person_id']与key_df['p_id']的格式完全一致(无大小写差异、空格或特殊字符)
  • 确保key_df中p_id无重复值,否则set_index后只会保留最后一个匹配的location值

简化后的Map代码如下:

# 构建p_id到location的映射字典
location_mapping = key_df.set_index('p_id')['location']
# 为data_df添加location列
data_df['location'] = data_df['person_id'].map(location_mapping)

最终示例输出

两种方法得到的结果均为:

person_idcompanydept_accesslocation
abc@gmail.comaa1UK
abc@gmail.comaa1UK
abc@gmail.comaa1UK
ace@gmail.comaa1NaN
ace@gmail.comaa2NaN
pqr@gmail.comaa2KOREA
pqr@gmail.comaa2KOREA

内容的提问来源于stack exchange,提问作者The Great

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.26 01:48:20