如何使用R语言对指定数据集进行去重处理?
R语言实现数据集按行组合去重
首先先把你的示例数据集用R代码还原,方便直接测试:
# 构建示例数据集 df <- data.frame( Col1 = c("a", "a", "a", "a", "a", "a", "b", "b", "b", "b", "b", "b"), Col2 = c(1, 2, 2, 4, 4, 4, 2, 6, 7, 9, 7, 7) )
方法一:Base R 原生函数 unique()
直接使用unique()函数对整个数据框操作,它会自动保留所有列的唯一组合:
df_unique <- unique(df)
方法二:dplyr 包的 distinct() 函数
如果你习惯用tidyverse系列工具,dplyr的distinct()函数更直观,默认也是保留所有列的唯一行:
# 先安装(首次使用)并加载dplyr包 # install.packages("dplyr") library(dplyr) df_unique <- df %>% distinct()
运行任意一种方法后,df_unique就是你想要的去重结果,和Excel里的去重效果一致。
内容的提问来源于stack exchange,提问作者Sundew
相关产品推荐
相关产品推荐

