You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在dplyr::summarise中使用句号(.)引用分组内子表的问题

在dplyr::summarise中使用句号(.)引用分组内子表的问题

你遇到的这个问题其实是dplyr分组语境下引用数据的常见误区——在group_by()之后直接用summarise(res = myFUN(.))时,这里的.指向的还是原始的完整数据框,而非当前分组的子数据集,所以才会得到三组结果完全相同的情况。

问题重现

首先是你的输入数据和自定义函数:

require(dplyr)

set.seed(123)

df <- tibble(g = rep(x = c("A", "B", "C"), times = c(3, 5, 7)),
             a = sample(x = 1:100, size = 15),
             b = sample(x = 1:100, size = 15))

# 自定义函数
myFUN <- function(x){
  mean(x$a + x$b)
}

你尝试的错误写法及得到的错误结果:

# 错误写法:所有分组结果一致
df %>%
  group_by(g) %>%
  summarise(res = myFUN(.))

输出:

# A tibble: 3 × 2
  g       res
  <chr> <dbl>
1 A      112.
2 B      112.
3 C      112.

你用循环实现的预期结果是正确的:

# 预期结果(循环实现)
out <- list()
for(i in unique(df$g)){
  out[[length(out) + 1]] <- tibble(g = i,
                                   res = df %>% filter(g == i) %>% myFUN)
}
out |> bind_rows()

输出:

# A tibble: 3 × 2
  g       res
  <chr> <dbl>
1 A      98.3
2 B     126.
3 C     109.

正确解决方案

要让函数处理每个分组的子表,我们可以用group_map()来实现,它会自动把每个分组的子数据框传递给指定函数:

df %>%
  group_by(g) %>%
  group_map(.f = function(.x, .y){
    .x %>%
      summarise(res = myFUN(.)) %>%
      mutate(g = .y$g, .before = 1)
  }) %>%
  bind_rows()

这里的.x就是当前分组的子数据框,.y则是包含当前分组键信息的小数据框,我们用它把分组标识g加回到结果里,最后用bind_rows()合并所有分组结果,就能得到和循环一致的正确输出。

补充简化方案

如果你不想用group_map(),也可以修改自定义函数,让它直接接受列参数,这样更贴合dplyr的语法习惯:

# 修改后的函数
myFUN2 <- function(a, b){
  mean(a + b)
}

# 直接在summarise中调用
df %>%
  group_by(g) %>%
  summarise(res = myFUN2(a, b))

这种写法更简洁,同样能得到正确的分组计算结果。

备注:内容来源于stack exchange,提问作者Wencheng Lau-Medrano

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.20 07:59:34