如何用R判断数据框两列地址值是否达到至少95%匹配度?
解决方案
我们可以借助stringdist包计算地址字符串的相似度,以此判断两组地址是否达到95%以上的匹配度,具体实现步骤如下:
- 安装并加载
stringdist包
install.packages("stringdist") library(stringdist)
- 计算相似度并生成匹配标记列
使用stringsim()函数计算两组地址的相似度(取值范围0-1,1代表完全匹配),通过ifelse()判断是否满足≥95%的匹配要求,生成"Yes"/"No"标记:
df$Match_Result <- ifelse(stringsim(df$`Home Address`, df$`Mail Address`, method = "cosine") >= 0.95, "Yes", "No")
如果偏好基于字符集合的Jaccard相似度计算,只需将method参数改为"jaccard"即可:
df$Match_Result <- ifelse(stringsim(df$`Home Address`, df$`Mail Address`, method = "jaccard") >= 0.95, "Yes", "No")
- 查看最终结果
运行上述代码后,你的DataFrame会新增Match_Result列,示例数据的输出如下:
> df Client Home Address Mail Address Match_Result 1 Client1 123 N. Franklin Ave. 123 Franklin Avenue Yes 2 Client2 345 Circle Drive 345 S. Circle Dr. Yes 3 Client3 567 Smith St. Suite 5 567 Smith Street Ste 5 Yes 4 Client4 678 Buchanan Rd. SW 678 Buchanan Road Yes 5 Client5 12 State Street 17 Ralph Lane No
补充优化方案
如果想进一步提升匹配精度,可以先对地址做标准化处理(统一缩写、去除方向词、统一大小写等),再计算相似度:
# 定义地址标准化函数 standardize_address <- function(addr) { addr <- tolower(addr) addr <- gsub("\\.", "", addr) # 移除点号 # 统一各类街道缩写 addr <- gsub("ave|avenue", "avenue", addr) addr <- gsub("st|street", "street", addr) addr <- gsub("dr|drive", "drive", addr) addr <- gsub("rd|road", "road", addr) addr <- gsub("suite|ste", "suite", addr) addr <- gsub("n |s |e |w |sw |nw |se |ne ", "", addr) # 移除方向词 return(addr) } # 生成标准化后的地址列 df$Home_Standard <- standardize_address(df$`Home Address`) df$Mail_Standard <- standardize_address(df$`Mail Address`) # 基于标准化地址计算匹配结果 df$Match_Standard <- ifelse(stringsim(df$Home_Standard, df$Mail_Standard, method = "cosine") >= 0.95, "Yes", "No")
标准化处理能有效规避格式差异带来的误判,让匹配结果更精准。
内容的提问来源于stack exchange,提问作者MKN17
相关产品推荐
相关产品推荐

