You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

按名称分组求和新增列:R语言高效处理DataFrame多列问题

嘿,我来帮你搞定这个高效分组求和的问题!

问题背景

你现有的数据集:

df <- data.frame('a_1' = c(1,0,0), 'b_1' = c(1,0,0), 'c_1' = c(1,0,0), 'a_2' = c(0,1,0), 'b_2' = c(0,1,0), 'c_2' = c(0,1,0))

期望得到的结果:

df
a b c
1 1 1 1
2 1 1 1
3 0 0 0

下面分享两种高效的批量分组求和方法,再也不用手动逐个赋值啦!


方法1:用tidyverse工具包(直观易读)

这是处理这类数据重塑问题的主流方案,代码逻辑清晰,扩展性强:

library(tidyverse)

df_new <- df %>%
  # 把宽格式转成长格式,拆分列名为前缀和数字后缀
  pivot_longer(everything(), 
               names_to = c("prefix", "suffix"), 
               names_sep = "_") %>%
  # 按行号和前缀分组,对数值求和
  group_by(row_number(), prefix) %>%
  summarise(value = sum(value), .groups = "drop") %>%
  # 转回宽格式
  pivot_wider(names_from = prefix, values_from = value) %>%
  # 移除自动生成的行号列
  select(-`row_number()`)

这个方法不管你有多少列(哪怕是a_3、b_5这种带不同数字后缀的),都能自动识别分组,完全不用手动指定列名,超级省心!


方法2:用Base R(无需额外安装包)

如果不想加载第三方包,用原生R代码也能实现:

# 提取所有列名的前缀(去掉下划线和后面的数字)
prefixes <- unique(sub("_\\d+$", "", colnames(df)))

# 遍历每个前缀,筛选对应列并逐行求和
df_new <- data.frame(lapply(prefixes, function(p) {
  rowSums(df[, grepl(paste0("^", p, "_"), colnames(df))])
}))

# 给新数据框设置列名
colnames(df_new) <- prefixes

核心是用正则表达式匹配指定前缀的列,再通过rowSums批量计算每行的和,完美适配大规模数据集。


验证结果

不管用哪种方法,运行后查看结果:

print(df_new)

输出都会和你期望的一致:

a b c
1 1 1 1
2 1 1 1
3 0 0 0

内容的提问来源于stack exchange,提问作者Edward

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.15 04:20:16