合并两个DataFrame后坐标列大量NA,如何为每个位置匹配坐标?
解决DataFrame合并后坐标列大量NA的问题
你的merge代码逻辑本身没问题,出现大量NA的核心原因不是行数不相等或仅匹配第一个地点,而是data$Location和clean_lonlat$clean_naam中的地点名称存在不匹配情况(比如大小写差异、前后空格、特殊字符不一致)。以下是具体解决步骤:
1. 排查名称匹配情况
先确认有多少地点名称无法匹配:
# 统计匹配/不匹配的数量 table(data$Location %in% clean_lonlat$clean_naam)
如果输出里FALSE的数量较多,说明名称格式不一致是核心问题。
2. 统一地点名称格式
对两列字符串做标准化处理,消除格式差异:
# 转换为小写+去除前后空格 data$Location <- tolower(trimws(data$Location)) clean_lonlat$clean_naam <- tolower(trimws(clean_lonlat$clean_naam)) # 若存在特殊字符差异(如下划线/连字符),可进一步替换 # data$Location <- gsub("_", "-", data$Location) # clean_lonlat$clean_naam <- gsub("_", "-", clean_lonlat$clean_naam)
3. 重新执行合并
此时用原merge或dplyr::left_join都能实现所有地点的坐标匹配:
方法1:base R的merge
data.coordinates <- merge(data, clean_lonlat, by.x="Location", by.y="clean_naam", all.x=TRUE)
方法2:dplyr的left_join(语法更直观)
library(dplyr) data.coordinates <- data %>% left_join(clean_lonlat, by = c("Location" = "clean_naam"))
这两种方法都会自动为data中每个地点的所有行匹配对应坐标,不会仅匹配第一个出现的地点。
内容的提问来源于stack exchange,提问作者June
相关产品推荐
相关产品推荐

