如何识别并排除两个推文DataFrame中的重复行?
我来帮你搞定这个问题——识别并移除df1和df2之间的重复行其实有几种清晰的实操方法,咱们一步步来拆解:
要找出两个DataFrame之间的重复行,有两种直观的方式:
方法1:标记来源后找重复
先给两个DataFrame加上来源标识,合并后就能追踪重复行的出处:
# 给每个数据集添加来源标记,方便后续查看重复行来自哪里 df1$source <- "sons" df2$source <- "daughters" # 合并两个数据集 combined_df <- rbind(df1, df2) # 找出所有内容重复的行(忽略source列,因为来源不同但内容一致才是目标重复) duplicate_entries <- combined_df[ duplicated(combined_df[, !names(combined_df) %in% "source"]) | duplicated(combined_df[, !names(combined_df) %in% "source"], fromLast = TRUE), ]
运行后,duplicate_entries里会包含所有在df1和df2中重复的行,你能通过source列看到它们分别来自儿子或女儿的数据集。
方法2:用交集找完全匹配的行
如果你的两个DataFrame列名完全一致,可以用dplyr的inner_join直接找出两者的交集(也就是完全重复的行):
library(dplyr) # 找出df1和df2中完全匹配的行 common_rows <- inner_join(df1, df2, by = names(df1))
这个结果就是两个数据集共有的重复内容。
接下来是核心需求——移除重复行,分两种场景处理:
场景1:两边都移除重复行(即两个数据集里只要是重复的行都删掉)
用anti_join可以轻松实现,它会返回在第一个数据集中存在,但在第二个数据集中没有的行:
library(dplyr) # 清理df1:移除所有和df2重复的行 df1_clean <- anti_join(df1, df2, by = names(df1)) # 清理df2:移除所有和df1重复的行 df2_clean <- anti_join(df2, df1, by = names(df2))
这样df1_clean和df2_clean就各自只保留了独有的推文,没有互相重复的内容。
场景2:保留其中一个数据集的重复行,移除另一个中的
比如你想保留df1里的所有行,只删掉df2中与df1重复的部分:
df2_clean <- anti_join(df2, df1, by = names(df2)) # df1保持不变,df2_clean是去重后的版本
反过来如果要保留df2的内容,清理df1,把两个df的位置调换即可。
补充:基于合并去重后的结果拆分
如果你已经用alltogether <- unique(rbind(df1, df2))得到了去重后的合并数据集,也可以给原数据集加来源标记后,拆分回两个干净的数据集:
# 先给原df加来源标记 df1$source <- "sons" df2$source <- "daughters" # 合并去重 alltogether <- unique(rbind(df1, df2)) # 拆分回干净的df1和df2 df1_clean <- alltogether[alltogether$source == "sons", ] df2_clean <- alltogether[alltogether$source == "daughters", ] # 不需要source列的话可以删掉 df1_clean$source <- NULL df2_clean$source <- NULL
小提醒
如果你的DataFrame里有一些不需要参与重复判断的列(比如自动生成的行号、时间戳等),记得在by参数里指定具体的列名,而不是直接用names(df1)。比如只根据text和user_id判断重复,就写成by = c("text", "user_id")。
内容的提问来源于stack exchange,提问作者Laura Ataraxia

