使用read_excel导入数据,如何将字符串NA识别为缺失值?
解决read_excel识别字符串"NA"为缺失值的问题
你当前的代码仅将空字符串识别为缺失值,但数据里实际存在大量字符串类型的"NA",需要调整na参数的取值:
- 修改导入代码,把"NA"加入缺失值识别列表:
data <- read_excel(workbook_path, na = c("", "NA"))
如果导入后仍有遗漏(比如存在大小写不一致的"Na"/"nA"),可以用以下方式批量替换:
- base R 处理方式:
data[data == "NA"] <- NA
- dplyr 包批量处理方式:
library(dplyr) data <- data %>% mutate(across(everything(), ~na_if(., "NA")))
处理完成后,运行colSums(is.na(data))就能正确统计各列的缺失值数量了。
内容的提问来源于stack exchange,提问作者Issam K
相关产品推荐
相关产品推荐

