R tidyverse分组计算均值时如何让缺失分组变量的结果为NA
R tidyverse分组计算均值时分组变量为NA返回缺失值的解决方案
问题原因
- 第一种写法失败原因:dplyr的
group_by()默认会将NA识别为一个独立的分组,所以id为NA的行所属分组会计算该组的均值,不会返回NA。 - 第二种写法报错原因:
dplyr::if_else()要求真假两个分支返回的变量类型完全一致,你写的NA默认是逻辑类型,而mean(data)返回的是双精度数值类型,类型不匹配触发报错。
解决方案
方案1:修复if_else的缺失值类型
将逻辑型的NA替换为双精度类型的缺失值NA_real_即可解决类型不匹配问题:
df <- df %>% group_by(id) %>% mutate(id_avg = if_else(!is.na(id), mean(data), NA_real_))
方案2:组级判断优化写法
因为同一分组的id取值完全一致,不需要逐行判断,每个组只做一次判断即可,运行效率更高:
df <- df %>% group_by(id) %>% mutate(id_avg = if (is.na(first(id))) NA_real_ else mean(data))
方案3:过滤NA分组后左连接
先过滤掉id为NA的行计算均值,再和原表左连接,id为NA的行自然匹配不到结果,自动返回NA:
df <- df %>% left_join( df %>% filter(!is.na(id)) %>% group_by(id) %>% summarise(id_avg = mean(data)), by = "id" )
内容的提问来源于stack exchange,提问作者nicholas
相关产品推荐
相关产品推荐

