Python实现:用匹配DataFrame条目替换目标DataFrame列缺失值
用df2匹配填充df1中b列的缺失值
嘿,这个需求其实很常见,用pandas的几个方法就能轻松搞定。我来给你一步步拆解:
首先先确认下你的示例数据:
import pandas as pd import numpy as np df1 = pd.DataFrame({'A': [1,2,3,4,5,6,7,8], 'b': [101,123,np.nan,678,np.nan,672,np.nan,786], 'C': ['ABC', 'DER', 'ERC','DFE','HJI','JKL','SDH',np.Nan]}) df2 = pd.DataFrame({'A': [3,7], 'B': [563,785]})
我们的目标是把df1中b列的缺失值,替换成df2中同A值匹配的B值,同时保留那些df2中没有对应A值的缺失项(比如df1里A=5的b缺失,依然保留NaN)。
方法一:字典映射(高效推荐)
这种方法速度快,适合大数据量场景:
# 把df2转换成以A为键、B为值的映射字典 b_mapping = df2.set_index('A')['B'].to_dict() # 填充df1的b列缺失值 df1['b'] = df1['b'].fillna(df1['A'].map(b_mapping))
运行后你就能得到期望的结果:
A b C 0 1 101.0 ABC 1 2 123.0 DER 2 3 563.0 ERC 3 4 678.0 DFE 4 5 NaN HJI 5 6 672.0 JKL 6 7 785.0 SDH 7 8 786.0 NaN
原理说明:
df2.set_index('A')['B'].to_dict()把df2转成了{3:563, 7:785}这样的字典,方便快速查找。df1['A'].map(b_mapping)会生成一个序列:只有A=3和A=7的位置有对应值,其他都是NaN。fillna()只会替换b列原本的缺失值,完美匹配你的需求。
方法二:左连接填充(直观易懂)
如果你对join操作更熟悉,也可以用merge的方式:
# 左连接df1和df2,保留df1的所有行 merged_df = df1.merge(df2, on='A', how='left') # 用B列的值填充b列的缺失 df1['b'] = merged_df['b'].fillna(merged_df['B'])
这个方法逻辑更直观:先把两个表按A值关联,再用关联后的B值去填充缺失的b,效果和方法一完全一致。
两种方法都能满足你的需求,你可以根据自己的习惯和数据规模选择~
内容的提问来源于stack exchange,提问作者Poo
相关产品推荐
相关产品推荐

