如何用字符数组中的标签通过dplyr的case_match()实现值重编码?
在case_match()中使用存储的标签进行值重编码
当然可以实现,核心思路是将存储的标签(字符向量或CSV读取的映射关系)转换成case_match()所需的公式格式,再通过非标准求值注入到函数中。以下是具体实现方法:
方法1:基于字符向量生成匹配规则
假设你已有类似原recode()使用的命名字符向量标签:
library(dplyr) library(rlang) # 定义标签映射 lbls <- c( 'male' = 'Man', 'female' = 'Woman' ) # 将标签转换为case_match需要的公式列表(old ~ new) match_cases <- imap(lbls, ~ new_formula(.y, .x)) # 注:imap会遍历向量的名字(旧值)和值(新值),new_formula创建公式对象 # 使用case_match重编码 starwars %>% select(sex) %>% mutate( sex = case_match(sex, !!!match_cases, .default = sex) )
!!!match_cases会将公式列表展开为case_match()的多个参数,等价于手动写male ~ "Man", female ~ "Woman".default = sex确保未匹配到的原始值(比如示例中的none)保持不变,和recode()的默认行为一致
方法2:从CSV文件读取标签映射
如果标签存储在CSV文件(比如包含old和new两列),可以先读取数据再生成匹配规则:
# 读取CSV标签文件(假设文件内容包含old和new列) lbls_df <- read.csv("labels.csv", stringsAsFactors = FALSE) # 生成公式列表 match_cases <- map2(lbls_df$old, lbls_df$new, ~ new_formula(.x, .y)) # 同样用case_match重编码 starwars %>% select(sex) %>% mutate( sex = case_match(sex, !!!match_cases, .default = sex) )
不用purrr的base R替代方案
如果不想依赖purrr包,也可以用base R生成公式列表:
match_cases <- lapply(names(lbls), function(old_val) { new_formula(old_val, lbls[old_val]) })
以上方法最终输出的结果和原recode()的效果完全一致,同时兼容case_match()的语法要求。
内容的提问来源于stack exchange,提问作者teppo
相关产品推荐
相关产品推荐

