You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R tidyverse分组计算均值时如何让缺失分组变量的结果为NA

R tidyverse分组计算均值时分组变量为NA返回缺失值的解决方案

问题原因

  • 第一种写法失败原因:dplyr的group_by()默认会将NA识别为一个独立的分组,所以id为NA的行所属分组会计算该组的均值,不会返回NA。
  • 第二种写法报错原因:dplyr::if_else()要求真假两个分支返回的变量类型完全一致,你写的NA默认是逻辑类型,而mean(data)返回的是双精度数值类型,类型不匹配触发报错。

解决方案

方案1:修复if_else的缺失值类型

将逻辑型的NA替换为双精度类型的缺失值NA_real_即可解决类型不匹配问题:

df <- df %>% 
  group_by(id) %>%
  mutate(id_avg = if_else(!is.na(id), mean(data), NA_real_))

方案2:组级判断优化写法

因为同一分组的id取值完全一致,不需要逐行判断,每个组只做一次判断即可,运行效率更高:

df <- df %>% 
  group_by(id) %>%
  mutate(id_avg = if (is.na(first(id))) NA_real_ else mean(data))

方案3:过滤NA分组后左连接

先过滤掉id为NA的行计算均值,再和原表左连接,id为NA的行自然匹配不到结果,自动返回NA:

df <- df %>%
  left_join(
    df %>%
      filter(!is.na(id)) %>%
      group_by(id) %>%
      summarise(id_avg = mean(data)),
    by = "id"
  )

内容的提问来源于stack exchange,提问作者nicholas

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 20:57:04