如何用summarise函数列出因子变量全水平及解决输出行数限制问题
关于dplyr::summarise的两个常见问题解答
嘿,这两个问题我之前处理因子变量时都碰到过,给你详细说说怎么解决:
问题1:如何使用summarise函数列出因子变量的所有水平?
其实核心思路是先按因子变量分组,再用summarise做汇总——这样每个因子水平都会对应一行结果,自然就能列出所有水平了。举个实际例子,假设我们用内置的mtcars数据集,把cyl转成因子变量,然后用summarise列出所有水平并统计每组的观测数:
library(dplyr) # 把cyl转为因子变量 mtcars$cyl <- as.factor(mtcars$cyl) # 按cyl分组,汇总每组的观测数,同时列出所有因子水平 mtcars %>% group_by(cyl) %>% summarise(观测数量 = n())
运行后你会看到cyl的所有三个水平(4、6、8)都被列出来,每个水平对应一行汇总结果。如果只是想单纯列出所有因子水平,也可以在summarise里直接返回水平列表,但分组后汇总的方式更实用,毕竟通常我们都会配合统计指标一起用。
问题2:当Neighborhood为包含20余个水平的因子变量时,使用summarise函数查看所有水平的标准差仅能显示10行,该如何解决?
这个是dplyr默认的打印行数限制在搞事情——它默认只显示前10行结果,超过的话会被截断。给你三个简单的解决办法:
- 方法1:打印时指定显示所有行
先把汇总结果存到变量里,然后用print()函数的n参数设置为Inf(无限),就能显示全部行了:
# 假设你的数据集叫df,要计算的数值变量叫price summary_result <- df %>% group_by(Neighborhood) %>% summarise(价格标准差 = sd(price, na.rm = TRUE)) # 显示所有行 print(summary_result, n = Inf)
- 方法2:修改dplyr的全局打印选项
如果你不想每次都手动指定,那就直接修改全局选项,让dplyr默认显示所有行:
# 设置dplyr打印最大行数为无限 options(dplyr.print_max = Inf) # 之后再运行summarise,结果就会全部显示出来了 df %>% group_by(Neighborhood) %>% summarise(价格标准差 = sd(price, na.rm = TRUE))
- 方法3:转成普通数据框打印
把dplyr的分组结果转成基础R的数据框,打印时就不会有行数限制了(20多行完全没问题):
df %>% group_by(Neighborhood) %>% summarise(价格标准差 = sd(price, na.rm = TRUE)) %>% as.data.frame()
内容的提问来源于stack exchange,提问作者Shea
相关产品推荐
相关产品推荐

