R中按组对dataframe指定列应用自定义函数并保留分组标识的方法
问题原因说明
- 你之前写的
apply版本没有做分组计算,返回的是全数据集的聚合结果,不符合分组统计的需求 - 你写的map版本存在两个问题:
- 分组后直接调用
map_at会将分组数据集拆解为列表结构,无法和后续的data.frame()转换逻辑匹配,所以会报行数不一致的错误 - 匿名函数中直接调用
date_data[,7]取的是全局全量数据集的date5列,而非分组内的date5列,计算逻辑本身就是错误的
- 分组后直接调用
正确实现方案
推荐使用tidyverse中dplyr::summarise + dplyr::across的组合实现,逻辑简洁易读:
# 建议重命名自定义函数避免和R内置的mad函数冲突 my_mad <- function(x, y) abs(mean(x - y, na.rm = TRUE)) result <- date_data %>% # 按name字段分组 group_by(name) %>% # 对date1到date4列逐列应用自定义计算 summarise( across(date1:date4, ~ my_mad(.x, date5)) )
运行后得到的result就是符合要求的结果:共2行,对应groupA、groupB两个分组,列包含name以及date1~date4对应的平均绝对差计算结果。
如果一定要使用map系列函数实现,可以配合group_modify完成:
result_map <- date_data %>% group_by(name) %>% group_modify(~ map_dfr(select(.x, date1:date4), ~ my_mad(.x, .y$date5), .y = .x)) %>% ungroup()
内容的提问来源于stack exchange,提问作者Joshua Culpepper
相关产品推荐
相关产品推荐

