You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在R中重编码变量:仅保留指定两类并将其余设为缺失值

重编码变量保留指定类别并设其余为缺失值的R实现

1. 通用方法:保留任意两个类别,其余设为缺失值

在R里做这种数据清理是很常见的需求,我给你演示两种常用的实现方式——base R和tidyverse(dplyr)的写法,你可以根据自己的习惯选择:

Base R 实现

假设你的目标变量是x,想要保留的两个类别是"类别1"和"类别2",直接用ifelse()结合%in%就能快速搞定:

# 针对字符型变量
x <- ifelse(x %in% c("类别1", "类别2"), x, NA)

# 如果是因子变量,也可以直接修改因子水平,不在指定水平内的会自动转为NA
x <- factor(x, levels = c("类别1", "类别2"))

Tidyverse(dplyr)实现

如果你习惯用dplyr处理数据框,用mutate()配合case_when()或者ifelse()都很灵活:

library(dplyr)

# 方法1:简洁的ifelse写法
df <- df %>%
  mutate(x = ifelse(x %in% c("类别1", "类别2"), x, NA))

# 方法2:case_when(更适合后续扩展多条件场景)
df <- df %>%
  mutate(x = case_when(
    x %in% c("类别1", "类别2") ~ x,
    TRUE ~ NA_character_  # 字符型变量用NA_character_,数值型用NA_real_
  ))

2. 针对V162034a变量的具体实现

要保留Hillary Clinton和Donald Trump这两个类别,其余设为缺失值,只需要把通用方法里的类别名称替换成具体值即可:

Base R 写法

# 假设你的数据框名为df
df$V162034a <- ifelse(df$V162034a %in% c("Hillary Clinton", "Donald Trump"), df$V162034a, NA)

# 如果变量是因子类型,直接修改水平更高效
df$V162034a <- factor(df$V162034a, levels = c("Hillary Clinton", "Donald Trump"))

Tidyverse 写法

library(dplyr)

df <- df %>%
  mutate(V162034a = case_when(
    V162034a %in% c("Hillary Clinton", "Donald Trump") ~ V162034a,
    TRUE ~ NA_character_
  ))

小提醒:如果你的变量原本是因子类型,处理后可以根据需要重新转换为因子,避免残留无用的旧水平~

内容的提问来源于stack exchange,提问作者Txcxa

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 10:40:22