自定义函数内使用dplyr的group_by报错是否与tidyeval相关?
问题原因
- dplyr默认使用非标准评估机制,直接在
group_by中写函数参数x时,dplyr会尝试在输入数据框中查找名为x的列,而非解析为你传入的参数对应的实际列名,这就是报错提示x列不存在的核心原因 - 若你尝试
{{x}}未生效,通常是三类原因:dplyr版本低于1.0.0(curly-curly运算符从1.0.0版本开始支持)、修改函数后未重新加载定义就调用、用.data[[x]]时传入的是非字符串格式的列名(.data[[ ]]仅接受字符串类型的列名参数) - 函数中硬编码全局数据集
factors会带来不可预期的环境依赖问题,也可能在部分场景下干扰参数解析
解决方案
方案1:适配无引号列名传参(匹配你当前的调用习惯)
这是最推荐的写法,要求dplyr版本≥1.0.0,同时将数据集作为参数传入避免全局依赖:
library(dplyr) # 函数定义 c_table_fn <- function(data, group_col){ data %>% group_by(year, mammogram, {{group_col}}) %>% summarize(n = n(), .groups = "drop") # .groups参数可消去分组提示 } # 调用方式和你原有习惯一致 c_table_fn(factors, sp)
如果你必须使用1.0.0以下版本的dplyr,可以用旧版tidy evaluation写法:
c_table_fn <- function(data, group_col){ group_col <- enquo(group_col) data %>% group_by(year, mammogram, !!group_col) %>% summarize(n = n(), .groups = "drop") }
方案2:适配字符串列名传参(适合批量循环场景)
如果你需要批量传入列名字符串调用函数,使用.data[[ ]]写法:
c_table_fn <- function(data, group_col_str){ data %>% group_by(year, mammogram, .data[[group_col_str]]) %>% summarize(n = n(), .groups = "drop") } # 调用时传入带引号的列名 c_table_fn(factors, "sp")
内容的提问来源于stack exchange,提问作者Sean McClellan
相关产品推荐
相关产品推荐

