如何基于另一DataFrame的列名与部分匹配动态为Pandas添加新列?
问题
现有两个Pandas DataFrame(df1和df2),需要根据df2指定的ColumnName,将df2的ifExist值与df1对应列做部分匹配,为df1添加TarName列。目前已实现单列匹配的代码,寻求更动态的通用实现方法。
示例数据
import pandas as pd data1 = {'Column1': [1, 2, 3], 'Column2': ['Account', 'Biscut', 'Super'], 'Column3': ['Funny', 'Super', 'Nice']} df1 = pd.DataFrame(data1) data2 = {'ColumnName':['Column2','Column3','Column1'], 'ifExist':['Acc','Sup',3], 'TarName':['Account_name','Super_name','Val_3']} df2 = pd.DataFrame(data2)
预期输出
Column1 Column2 Column3 TarName 0 1 Account Funny Account_name 1 2 Biscut Super Super_name 2 3 Super Nice Val_3
现有单列匹配代码
df2_Column2_dict = df2[df2['ColumnName']=='Column2'].set_index(['ifExist'])['TarName'].to_dict() pat = r'({})'.format('|'.join(df2_Column2_dict.keys())) extracted = df1['Column2'].str.extract(pat, expand=False).dropna() df1['TarName'] = extracted.apply(lambda x: df2_Column2_dict[x]).reindex(df2.index) print(df1)
通用实现方案
可以通过遍历df2中的每一条匹配规则,对df1对应列执行匹配逻辑,批量为符合条件的行赋值TarName,代码如下:
import pandas as pd # 初始化示例数据 data1 = {'Column1': [1, 2, 3], 'Column2': ['Account', 'Biscut', 'Super'], 'Column3': ['Funny', 'Super', 'Nice']} df1 = pd.DataFrame(data1) data2 = {'ColumnName':['Column2','Column3','Column1'], 'ifExist':['Acc','Sup',3], 'TarName':['Account_name','Super_name','Val_3']} df2 = pd.DataFrame(data2) # 初始化TarName列 df1['TarName'] = None # 遍历每条匹配规则 for _, rule in df2.iterrows(): target_col = rule['ColumnName'] match_content = rule['ifExist'] assign_name = rule['TarName'] # 区分字符串和数值类型的匹配逻辑 if isinstance(match_content, str): # 字符串部分匹配(case=False忽略大小写,可按需调整) match_mask = df1[target_col].str.contains(match_content, case=False, na=False) else: # 数值类型精确匹配 match_mask = df1[target_col] == match_content # 为匹配到的行赋值TarName df1.loc[match_mask, 'TarName'] = assign_name print(df1)
代码说明
- 先初始化
TarName列为空值,避免后续赋值时出现覆盖冲突 - 遍历df2的每条规则,根据
ifExist的类型选择匹配方式:- 字符串类型用
str.contains实现部分匹配 - 数值类型直接做精确匹配(对应示例中Column1和3的匹配逻辑)
- 字符串类型用
- 通过
loc批量为符合条件的行赋值对应的TarName,效率优于逐行处理
运行后即可得到符合预期的输出结果。
内容的提问来源于stack exchange,提问作者Roshan
相关产品推荐
相关产品推荐

