在R语言中按ColC分组对ColB求和并添加新列的方法
解决方案
你的需求是对连续相同的ColC分组,计算组内ColB的总和并赋值给组内每一行的ColD,而你现有代码只是计算了所有ColC=1的ColB总和,并将该单一值统一赋给整个ColD列,这显然不符合需求。
以下是几种可行的实现方法:
方法1:Base R实现
先通过cumsum生成连续ColC的分组标识,再用ave按分组计算总和:
# 构造示例数据集 df <- data.frame( ColA = c("A", "A", "B", "B", "C", "C", "A", "A", "B", "B"), ColB = c(2, 1, 3, 5, 2, 5, 1, 3, 7, 1), ColC = c(1, 1, 2, 2, 3, 3, 1, 1, 2, 2) ) # 生成连续分组ID df$group_id <- cumsum(c(TRUE, diff(df$ColC) != 0)) # 按分组计算ColB总和并赋值给ColD df$ColD <- ave(df$ColB, df$group_id, FUN = sum) # 可选:删除临时分组ID列 df$group_id <- NULL
方法2:dplyr(tidyverse)实现
利用cumsum创建连续分组,再通过group_by和mutate计算组内总和:
library(dplyr) df <- df %>% # 按连续相同的ColC创建分组 group_by(group_id = cumsum(c(TRUE, diff(ColC) != 0))) %>% mutate(ColD = sum(ColB)) %>% ungroup() %>% # 移除临时分组列 select(-group_id)
方法3:data.table实现(更简洁高效)
使用data.table的rleid函数直接生成连续分组ID,再按分组计算总和:
library(data.table) setDT(df)[, ColD := sum(ColB), by = rleid(ColC)]
执行上述任意一种方法后,都能得到你期望的输出结果:
| ColA | ColB | ColC | ColD |
|---|---|---|---|
| A | 2 | 1 | 3 |
| A | 1 | 1 | 3 |
| B | 3 | 2 | 8 |
| B | 5 | 2 | 8 |
| C | 2 | 3 | 7 |
| C | 5 | 3 | 7 |
| A | 1 | 1 | 4 |
| A | 3 | 1 | 4 |
| B | 7 | 2 | 8 |
| B | 1 | 2 | 8 |
内容的提问来源于stack exchange,提问作者akshit singh
相关产品推荐
相关产品推荐

