You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R中按组对dataframe指定列应用自定义函数并保留分组标识的方法

问题原因说明
  • 你之前写的apply版本没有做分组计算,返回的是全数据集的聚合结果,不符合分组统计的需求
  • 你写的map版本存在两个问题:
    1. 分组后直接调用map_at会将分组数据集拆解为列表结构,无法和后续的data.frame()转换逻辑匹配,所以会报行数不一致的错误
    2. 匿名函数中直接调用date_data[,7]取的是全局全量数据集的date5列,而非分组内的date5列,计算逻辑本身就是错误的
正确实现方案

推荐使用tidyverse中dplyr::summarise + dplyr::across的组合实现,逻辑简洁易读:

# 建议重命名自定义函数避免和R内置的mad函数冲突
my_mad <- function(x, y) abs(mean(x - y, na.rm = TRUE))

result <- date_data %>%
  # 按name字段分组
  group_by(name) %>%
  # 对date1到date4列逐列应用自定义计算
  summarise(
    across(date1:date4, ~ my_mad(.x, date5))
  )

运行后得到的result就是符合要求的结果:共2行,对应groupA、groupB两个分组,列包含name以及date1~date4对应的平均绝对差计算结果。

如果一定要使用map系列函数实现,可以配合group_modify完成:

result_map <- date_data %>%
  group_by(name) %>%
  group_modify(~ map_dfr(select(.x, date1:date4), ~ my_mad(.x, .y$date5), .y = .x)) %>%
  ungroup()

内容的提问来源于stack exchange,提问作者Joshua Culpepper

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 18:06:04