如何基于公共x列值合并两个DataFrame并仅保留匹配行?
问题分析
你遇到的重复行问题,核心原因是直接使用merge(df_1, df_2)会对两个数据框中同一x值的所有行做笛卡尔积(比如x4在df_1有2行、df_2有2行,就会生成2*2=4行)。而你的需求是保留df_1中与df_2共享x值的行,同时对应上df_2中该x统一的z值,且不产生多余重复。
解决方案
方法1:先去重df_2的x-z映射,再做内连接
因为你的df_2中同一x对应的z值完全一致,我们可以先提取唯一的x-z配对,再和df_1合并,这样就不会产生冗余行:
# 提取df_2中唯一的x-z对应关系 df_2_unique <- unique(df_2) # 合并(默认是内连接,只保留x在两个数据框都存在的行) result <- merge(df_1, df_2_unique, by = "x")
运行后得到的结果完全符合你的期望:
x y z 1 x4 0 1 2 x4 0 1 3 x5 1 1 4 x5 1 1 5 x5 1 1
方法2:用dplyr的简洁写法
如果你习惯使用tidyverse工具链,distinct()可以快速去重,inner_join()直接实现内连接,写法更直观:
library(dplyr) result <- df_1 %>% inner_join(distinct(df_2, x, z), by = "x")
方法3:结合你提到的intersect()手动过滤
你提到的intersect(df_1$x, df_2$x)也可以用来手动过滤数据框,再完成合并(同样需要先对df_2去重):
common_x <- intersect(df_1$x, df_2$x) # 过滤df_1,只保留公共x的行 df_1_filtered <- df_1[df_1$x %in% common_x, ] # 过滤并去重df_2 df_2_filtered <- unique(df_2[df_2$x %in% common_x, ]) # 合并 result <- merge(df_1_filtered, df_2_filtered, by = "x")
为什么之前的尝试不符合需求
merge(..., all = TRUE)是全连接,会保留两个数据框中所有的x值,不符合你只保留匹配行的要求;- 直接
merge(df_1, df_2)因为df_2中同一x存在重复行,触发了笛卡尔积逻辑,导致生成大量重复行。
内容的提问来源于stack exchange,提问作者user8831872
相关产品推荐
相关产品推荐

