如何在R中基于下一个有序子组获取分组的下一个值?
问题:基于下一个有序子组获取分组对应下一个值
我需要基于下一个有序子组编号,获取每个分组对应的下一个值。比如在示例数据中,分组2包含两个子组1,这两个值对应的下一个值都应该来自子组2的4。
可复现数据
df <- structure(list(group = c(1, 1, 1, 2, 2, 2, 2, 3, 3, 3, 3), subgroup = c(1, 2, 3, 1, 1, 2, 3, 1, 1, 2, 3), value = c(9, 8, 7, 8, 6, 4, 2, 2, 3, 7, 9)), class = "data.frame", row.names = c(NA, -11L))
查看数据:
group subgroup value 1 1 1 9 2 1 2 8 3 1 3 7 4 2 1 8 5 2 1 6 6 2 2 4 7 2 3 2 8 3 1 2 9 3 1 3 10 3 2 7 11 3 3 9
错误的实现方式
如果直接用行号取下一行的值,会得到错误结果——同一子组的多行无法正确对应到下一个子组的值:
library(dplyr) df %>% group_by(group) %>% mutate(next_value = value[row_number()+1])
错误输出:
# A tibble: 11 × 4 # Groups: group [3] group subgroup value next_value <dbl> <dbl> <dbl> <dbl> 1 1 1 9 8 2 1 2 8 7 3 1 3 7 NA 4 2 1 8 6 5 2 1 6 4 6 2 2 4 2 7 2 3 2 NA 8 3 1 2 3 9 3 1 3 7 10 3 2 7 9 11 3 3 9 NA
期望输出
group subgroup value next_value 1 1 1 9 8 2 1 2 8 7 3 1 3 7 NA 4 2 1 8 4 5 2 1 6 4 6 2 2 4 2 7 2 3 2 NA 8 3 1 2 7 9 3 1 3 7 10 3 2 7 9 11 3 3 9 NA
解决方案
可以通过match函数在每个分组内匹配当前子组+1的位置,提取对应的值,这样同一子组的所有行都会对应到下一个子组的值:
library(dplyr) df %>% group_by(group) %>% mutate( next_value = value[match(subgroup + 1, subgroup)] ) %>% ungroup()
代码解释
group_by(group):按分组独立处理数据match(subgroup + 1, subgroup):在当前分组内,定位subgroup+1对应的子组位置value[xxx]:提取该位置的value,若下一个子组不存在则返回NA
运行后即可得到期望的输出结果。
内容的提问来源于stack exchange,提问作者Quinten
相关产品推荐
相关产品推荐

