You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用FuzzyWuzzy跨两个DataFrame列匹配最佳相似项及相似度分数

跨DataFrame的字符串最佳匹配实现方案

核心实现思路

针对df1的每个账户名称,遍历df2的所有公司名称计算相似度,筛选出分数最高的匹配项,将匹配结果和分数合并到df1中。

完整代码示例

import pandas as pd
from difflib import SequenceMatcher

# 构造示例数据
df1 = pd.DataFrame({'Account_Name': ['samsung', 'tesla', 'microsoft']})
df2 = pd.DataFrame({'Company_name': ['samsung electronics', 'samsung Ltd', 'tesla motors', 'Microsoft corporation']})

def find_best_match(account_name):
    # 统一转小写消除大小写影响
    account_lower = account_name.lower()
    max_score = 0
    best_company = None
    for company in df2['Company_name']:
        company_lower = company.lower()
        # 计算相似度分数
        score = SequenceMatcher(None, account_lower, company_lower).ratio()
        # 更新最佳匹配
        if score > max_score:
            max_score = score
            best_company = company
    return (best_company, round(max_score, 2))

# 应用函数并拆分结果列
df1[['Best_Match_Company', 'Similarity_Score']] = df1['Account_Name'].apply(
    lambda x: pd.Series(find_best_match(x))
)

print(df1)

代码说明

  • 大小写统一处理:将所有字符串转为小写,避免因大小写差异(如Microsoft和microsoft)导致的分数偏差。
  • 相似度计算:使用SequenceMatcher.ratio()返回0-1之间的相似度分数,分数越高匹配度越高。
  • 最佳匹配筛选:遍历df2所有公司名称,实时更新当前最高分数对应的公司名称。
  • 结果合并:通过apply和pd.Series将函数返回的匹配结果和分数拆分为df1的两列。

输出结果

Account_Name    Best_Match_Company  Similarity_Score
0       samsung       samsung electronics              0.62
1         tesla            tesla motors              0.67
2    microsoft  Microsoft corporation              0.53

内容的提问来源于stack exchange,提问作者Raul Gonzales

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.02 14:35:22