RStudio使用mutate、rowSums计算行总和排除指定列报错排查
第一个报错原因
第一次运行报no applicable method for 'mutate'的核心原因是没有将目标数据框作为mutate的第一个参数传入。
dplyr的mutate函数第一个位置参数必须是要操作的数据框对象,你最初的写法既没有把Flower放在mutate的第一个参数位,也没有用%>%管道把数据传给mutate,函数实际拿到的第一个输入是rowSums()计算后返回的数值向量——mutate没有针对数值向量的处理方法,直接触发报错。
第二个报错原因
第二次运行报"X必须为数值型"是因为select的筛选逻辑完全写反了。
你第二次的代码里用!c(...)排除的是所有需要统计的物种列,最后传给rowSums的是剩下的Survey、Date、Recorder、Treatment这类元数据列,这些列里包含日期、文本类的试验处理名称、记录人姓名等非数值内容,哪怕你确认所有物种列都是数值类型,这些混入的非数值列也会直接触发rowSums的类型报错。
首先确保已经加载dplyr包:
library(dplyr)
推荐用管道写法操作,逻辑清晰不容易写错参数位置,两种常用写法按需选择:
写法1:手动排除不需要统计的元数据列
和你最初的思路一致,明确排除样方编号、试验处理、日期等不需要求和的列,适合元数据列少、需要统计的列多的场景:
Flower <- Flower %>% mutate( total = rowSums( select(., -c(Survey, Date, Recorder, Site, Block, Plot, Treatment)), na.rm = TRUE ) )
代码里的.代表管道传入的原始数据框Flower,不会出现参数传错的问题,na.rm = TRUE会自动忽略列里的缺失值,避免结果返回NA。
写法2:自动筛选所有数值列计算
如果不需要统计的元数据列全是非数值类型,可以直接用where(is.numeric)自动选中所有数值列求和,不用手动列列名,更省事:
Flower <- Flower %>% mutate( total = rowSums( select(., where(is.numeric)), na.rm = TRUE ) )
注意:如果你的元数据里包含数值型的编号列(比如Block、Plot是数字格式的编号,不需要参与求和),不要用这个写法,还是用第一种手动排除元数据的方法,避免把编号算进总和。
内容的提问来源于stack exchange,提问作者Rachel97

