R数据处理:如何去除重复观测并保留两份观测的有效信息
R语言数据去重解决方案
核心逻辑是先定位重复出现的物种,再修改对应字段,最后过滤无效行即可,操作步骤如下:
1. 依赖安装(首次运行执行)
如果还没安装数据处理包,先执行安装代码:
install.packages("dplyr")
2. 加载包和数据
library(dplyr) # 此处示例数据可替换为你自己的数据集 df <- structure(list(species = structure(c(1L, 2L, 3L, 4L, 2L, 3L), .Label = c("Aa achalensis", "Aa argyrolepis", "Aa aurantiaca", "Aa calceata"), class = "factor"), establishment = structure(c(1L, 1L, 1L, 1L, 2L, 2L), .Label = c("farm", "field"), class = "factor"), region = structure(c(1L, 1L, 1L, 1L, 1L, 1L), .Label = "ABT", class = "factor"), leaf.area = c(0.348046463, 0.265755867, 0.382584479, 0.336147631, NA, NA), ses = c(-0.3906, -0.6257, -0.2987, -0.423, NA, NA)), row.names = c(NA, 6L), class = "data.frame")
3. 核心处理代码
df_result <- df %>% # 标记出现次数大于1的重复物种 group_by(species) %>% mutate(is_duplicated_species = n() > 1) %>% ungroup() %>% # 将重复物种的establishment字段从farm修改为field mutate(establishment = as.character(establishment), establishment = ifelse(is_duplicated_species & establishment == "farm", "field", establishment), establishment = as.factor(establishment)) %>% # 删除最后两列全为NA的field行 filter(!(establishment == "field" & is.na(leaf.area) & is.na(ses))) %>% # 移除辅助标记列 select(-is_duplicated_species)
处理结果示例
最终得到的df_result结构如下,完全符合需求:
| species | establishment | region | leaf.area | ses |
|---|---|---|---|---|
| Aa achalensis | farm | ABT | 0.3480465 | -0.3906 |
| Aa argyrolepis | field | ABT | 0.2657559 | -0.6257 |
| Aa aurantiaca | field | ABT | 0.3825845 | -0.2987 |
| Aa calceata | farm | ABT | 0.3361476 | -0.4230 |
基础R版本(无需安装额外包)
如果不想用dplyr,也可以用原生R语法实现:
# 标记重复物种 dup_species <- names(which(table(df$species) > 1)) # 修改establishment字段 df$establishment <- as.character(df$establishment) df$establishment[df$species %in% dup_species & df$establishment == "farm"] <- "field" df$establishment <- as.factor(df$establishment) # 过滤无效行 df_result <- df[!(df$establishment == "field" & is.na(df$leaf.area) & is.na(df$ses)), ]
内容的提问来源于stack exchange,提问作者Jose
相关产品推荐
相关产品推荐

