如何用R的dplyr移除面板数据中含NA的对应ID所有行?
用dplyr处理平衡面板的NA过滤需求
当然可以用dplyr实现你的需求,核心是找出所有在var1和var4中完全没有NA的id,然后保留这些id的全部行。下面给你两种可行的方法,同时解释你原来代码的问题:
方法一:直接分组过滤
这是最简洁的写法,一步到位:
library(dplyr) df_clean <- df %>% group_by(id) %>% # 检查当前id的所有var1和var4都没有NA filter(all(!is.na(var1)) & all(!is.na(var4))) %>% ungroup() # 记得取消分组,避免后续操作出错
方法二:先筛选合格id再过滤
如果需要单独查看合格的id,这种方法更直观:
# 第一步:找出所有var1和var4都无NA的id valid_ids <- df %>% group_by(id) %>% summarize( has_no_na = all(!is.na(var1)) & all(!is.na(var4)) ) %>% filter(has_no_na) %>% pull(id) # 提取id向量 # 第二步:保留这些id的所有行 df_clean <- df %>% filter(id %in% valid_ids)
你的原代码问题分析
你写的代码有两个关键问题:
select(c(var1,var4))会丢掉id、time以及其他变量,不符合你保留全部列的需求;filter(!is.na(.))中的.代表整个数据框,is.na(.)会返回一个和数据框同维度的逻辑矩阵,而filter只接受长度等于行数的逻辑向量,所以会报错。而且即使不报错,这一步也只是去掉单条有NA的行,不是移除整个id的所有行。
内容的提问来源于stack exchange,提问作者user24236624
相关产品推荐
相关产品推荐

