为何mutate(across)会将factor类型转换为integer类型?
问题原因与解决方案
为什么因子列被转为整数类型?
base::ifelse()函数的核心特性是强制统一输出结果的数据类型:
- 因子(factor)本质是带有标签的整数向量,当你在
ifelse中传入因子向量时,函数会提取其底层的整数编码进行处理; - 而
NA属于整数/逻辑类型,最终ifelse会把整个向量的类型统一为整数,导致因子的标签信息丢失,直接变成整数列。 - 额外提醒:因子列中根本不会存在
NaN(NaN是数值型特有的缺失值,因子的缺失表现为NA),所以你对因子列的处理完全是多余的,反而触发了类型转换。
避免类型转换的几种方法
方法1:用dplyr::if_else替代base::ifelse
dplyr的if_else会严格保留输入向量的原始类型,不会随意转换:
library(dplyr) x <- x %>% mutate(across(everything(), ~if_else(is.nan(.), NA, .)))
方法2:仅针对数值列处理(更高效)
既然只有数值列才会出现NaN,直接限定处理范围为数值列,完全不碰因子列:
x <- x %>% mutate(across(where(is.numeric), ~ifelse(is.nan(.), NA, .)))
方法3:使用replace函数
replace函数同样会保留原有向量的类型,适合替换特定条件的值:
x <- x %>% mutate(across(everything(), ~replace(., is.nan(.), NA)))
验证处理后的结果,用str(x)查看会发现x1依然是因子(factor)类型,数值列的NaN也已替换为NA。
内容的提问来源于stack exchange,提问作者canderson156
相关产品推荐
相关产品推荐

