如何在R的for循环中将列表元素作为数据框列名筛选?
R中循环使用字符串列名筛选数据框的问题解决
问题场景
当在for循环中用字符串形式的列名调用dplyr的filter()时,R会把字符串直接当作值处理,而非对应的数据框列,导致筛选逻辑失效——只能得到列选择正确但未经过筛选的数据。比如有如下数据框,需要循环筛选出SCORE_1>90和SCORE_2>90的子数据框:
library(dplyr) # 构造测试数据框 df <- data.frame( PERSON_NAME = c('JIM', 'SALLY', 'JOHN', 'SUE'), SCORE_1 = c(100, 95, 80, 85), SCORE_2 = c(95, 75, 90, 97) ) list_of_tests <- c("SCORE_1", "SCORE_2")
原始失效的循环代码:
for (i in 1:length(list_of_tests)) { x <- df %>% filter( list_of_tests[i] > 90 ) %>% select( PERSON_NAME, list_of_tests[i] ) assign(list_of_tests[i],x) }
解决方法
方法1:使用.data代词(推荐)
dplyr提供的.data代词可以直接通过字符串引用数据框的列,是符合tidyverse规范的写法:
for (i in seq_along(list_of_tests)) { col_name <- list_of_tests[i] x <- df %>% filter(.data[[col_name]] > 90) %>% select(PERSON_NAME, col_name) assign(col_name, x) }
方法2:使用rlang的非标准求值
通过sym()将字符串转换为符号,再用!!(bang-bang)强制求值,让dplyr识别为列名:
library(rlang) for (i in seq_along(list_of_tests)) { col_sym <- sym(list_of_tests[i]) x <- df %>% filter(!!col_sym > 90) %>% select(PERSON_NAME, !!col_sym) assign(list_of_tests[i], x) }
优化建议:避免assign(),用列表存储结果
assign()会在全局环境生成多个零散变量,不利于管理。推荐将所有结果存入一个列表:
result_list <- list() for (i in seq_along(list_of_tests)) { col_name <- list_of_tests[i] result_list[[col_name]] <- df %>% filter(.data[[col_name]] > 90) %>% select(PERSON_NAME, all_of(col_name)) } # 访问结果示例 result_list$SCORE_1 result_list$SCORE_2
内容的提问来源于stack exchange,提问作者UConn TK
相关产品推荐
相关产品推荐

