如何在lapply循环中按多列使用count函数统计数据?
解决字符串列名循环分组统计的问题
这个问题我之前也碰到过,tidyverse的公式语法遇上字符串列名确实容易卡壳,给你几个靠谱的解决办法:
方法一:用
sym()+!!解引用字符串
核心思路是把字符串格式的列名转换成tidyverse能识别的符号,再通过!!(bang-bang操作符)把它插入到count()的参数中:library(tidyverse) groupby <- c("cyl", "year", "trans") lapply(groupby, function(x) { mpg %>% count(!!sym(x)) })sym(x)会把字符串x转换成对应的列名符号(比如当x是"cyl"时,就变成cyl这个符号),!!则告诉count():不要把这个符号当成普通变量,而是把它当作数据框里的列来用。方法二:用
across()+all_of()选择列
如果不想用符号解引用,也可以借助across()来处理字符串列名,all_of()能精准匹配字符串对应的列:lapply(groupby, function(x) { mpg %>% count(across(all_of(x))) })这个方法更直观,
across(all_of(x))明确告诉count():就按x指定的那列来分组统计。方法三:用
as.symbol()+{{}}(curly-curly)
curly-curly操作符{{}}是tidyverse里用来传递变量的语法,配合as.symbol()转换字符串也能解决问题:lapply(groupby, function(x) { col <- as.symbol(x) mpg %>% count({{col}}) })
为什么原来的代码不行?
你之前用~x的写法,本质是创建了一个公式,但公式里的x会被当作数据框中的列名来解析——而你的mpg数据里并没有一列叫x,自然会报错。上面的方法都是在帮你把字符串格式的列名“翻译”成tidyverse能识别的分组条件。
内容的提问来源于stack exchange,提问作者Mark
相关产品推荐
相关产品推荐

