如何在R中使用mutate()和case_when()将指定值设为NA
解决方案:用mutate()+case_when()替换指定值为NA
1. 普通数值列的处理
你之前的代码出错是因为case_when()必须覆盖所有情况,只写A==99 ~ NA会让不满足条件的行全部被设为NA。正确写法需要添加默认分支保留原数值,同时指定匹配类型的NA:
library(dplyr) df <- data.frame(A = c(1,2,1,1,99,2,1,99,1)) # 正确的case_when写法 df <- df %>% mutate(A = case_when( A == 99 ~ NA_real_, # 用NA_real_指定数值型NA,避免类型冲突 TRUE ~ A # 默认分支:保留所有非99的原数值 ))
也可以用更简洁的na_if()函数,专门用来替换指定值为NA,效果完全一致:
df <- df %>% mutate(A = na_if(A, 99))
2. haven_labelled类型列的处理
对于haven包导入的带标签的数值列,核心逻辑和普通列一致,直接用case_when()或na_if()就能自动保留标签属性:
示例代码
library(haven) library(dplyr) # 构造带标签的测试数据 df_labelled <- data.frame( A = labelled(c(1,2,99,1,99), labels = c(有效=1, 无效=2, 缺失=99)) ) # 用case_when替换99为NA df_labelled <- df_labelled %>% mutate(A = case_when( A == 99 ~ NA_real_, TRUE ~ A )) # 用na_if更简洁 df_labelled <- df_labelled %>% mutate(A = na_if(A, 99)) # 验证标签属性是否保留 str(df_labelled$A)
解决报错问题
你遇到的object 'NA_double_' not found错误,是因为没有正确使用数值型NA的写法,base R中数值型NA的标准写法是NA_real_,而非NA_double_(后者并非base R的内置对象)。
内容的提问来源于stack exchange,提问作者code_to_joy
相关产品推荐
相关产品推荐

