使用FuzzyWuzzy跨两个DataFrame列匹配最佳相似项及相似度分数
跨DataFrame的字符串最佳匹配实现方案
核心实现思路
针对df1的每个账户名称,遍历df2的所有公司名称计算相似度,筛选出分数最高的匹配项,将匹配结果和分数合并到df1中。
完整代码示例
import pandas as pd from difflib import SequenceMatcher # 构造示例数据 df1 = pd.DataFrame({'Account_Name': ['samsung', 'tesla', 'microsoft']}) df2 = pd.DataFrame({'Company_name': ['samsung electronics', 'samsung Ltd', 'tesla motors', 'Microsoft corporation']}) def find_best_match(account_name): # 统一转小写消除大小写影响 account_lower = account_name.lower() max_score = 0 best_company = None for company in df2['Company_name']: company_lower = company.lower() # 计算相似度分数 score = SequenceMatcher(None, account_lower, company_lower).ratio() # 更新最佳匹配 if score > max_score: max_score = score best_company = company return (best_company, round(max_score, 2)) # 应用函数并拆分结果列 df1[['Best_Match_Company', 'Similarity_Score']] = df1['Account_Name'].apply( lambda x: pd.Series(find_best_match(x)) ) print(df1)
代码说明
- 大小写统一处理:将所有字符串转为小写,避免因大小写差异(如Microsoft和microsoft)导致的分数偏差。
- 相似度计算:使用
SequenceMatcher.ratio()返回0-1之间的相似度分数,分数越高匹配度越高。 - 最佳匹配筛选:遍历df2所有公司名称,实时更新当前最高分数对应的公司名称。
- 结果合并:通过
apply和pd.Series将函数返回的匹配结果和分数拆分为df1的两列。
输出结果
Account_Name Best_Match_Company Similarity_Score 0 samsung samsung electronics 0.62 1 tesla tesla motors 0.67 2 microsoft Microsoft corporation 0.53
内容的提问来源于stack exchange,提问作者Raul Gonzales
相关产品推荐
相关产品推荐

