You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何基于另一DataFrame的列名与部分匹配动态为Pandas添加新列?

问题

现有两个Pandas DataFrame(df1和df2),需要根据df2指定的ColumnName,将df2的ifExist值与df1对应列做部分匹配,为df1添加TarName列。目前已实现单列匹配的代码,寻求更动态的通用实现方法。

示例数据

import pandas as pd

data1 = {'Column1': [1, 2, 3],
        'Column2': ['Account', 'Biscut', 'Super'],
        'Column3': ['Funny', 'Super', 'Nice']}

df1 = pd.DataFrame(data1)

data2 = {'ColumnName':['Column2','Column3','Column1'],
     'ifExist':['Acc','Sup',3],
     'TarName':['Account_name','Super_name','Val_3']}
df2 = pd.DataFrame(data2)

预期输出

Column1 Column2 Column3       TarName
0        1 Account   Funny  Account_name
1        2  Biscut   Super   Super_name
2        3   Super    Nice        Val_3

现有单列匹配代码

df2_Column2_dict = df2[df2['ColumnName']=='Column2'].set_index(['ifExist'])['TarName'].to_dict()
pat = r'({})'.format('|'.join(df2_Column2_dict.keys()))
extracted = df1['Column2'].str.extract(pat, expand=False).dropna()
df1['TarName'] =  extracted.apply(lambda x: df2_Column2_dict[x]).reindex(df2.index)

print(df1)

通用实现方案

可以通过遍历df2中的每一条匹配规则,对df1对应列执行匹配逻辑,批量为符合条件的行赋值TarName,代码如下:

import pandas as pd

# 初始化示例数据
data1 = {'Column1': [1, 2, 3],
        'Column2': ['Account', 'Biscut', 'Super'],
        'Column3': ['Funny', 'Super', 'Nice']}
df1 = pd.DataFrame(data1)

data2 = {'ColumnName':['Column2','Column3','Column1'],
     'ifExist':['Acc','Sup',3],
     'TarName':['Account_name','Super_name','Val_3']}
df2 = pd.DataFrame(data2)

# 初始化TarName列
df1['TarName'] = None

# 遍历每条匹配规则
for _, rule in df2.iterrows():
    target_col = rule['ColumnName']
    match_content = rule['ifExist']
    assign_name = rule['TarName']
    
    # 区分字符串和数值类型的匹配逻辑
    if isinstance(match_content, str):
        # 字符串部分匹配(case=False忽略大小写,可按需调整)
        match_mask = df1[target_col].str.contains(match_content, case=False, na=False)
    else:
        # 数值类型精确匹配
        match_mask = df1[target_col] == match_content
    
    # 为匹配到的行赋值TarName
    df1.loc[match_mask, 'TarName'] = assign_name

print(df1)

代码说明

  1. 先初始化TarName列为空值,避免后续赋值时出现覆盖冲突
  2. 遍历df2的每条规则,根据ifExist的类型选择匹配方式:
    • 字符串类型用str.contains实现部分匹配
    • 数值类型直接做精确匹配(对应示例中Column1和3的匹配逻辑)
  3. 通过loc批量为符合条件的行赋值对应的TarName,效率优于逐行处理

运行后即可得到符合预期的输出结果。

内容的提问来源于stack exchange,提问作者Roshan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.23 21:13:18