R使用coronavirus包统计新冠病例时sum返回NA_integer如何解决
问题原因
- R基础函数
sum()默认输入中存在NA值时直接返回NA,返回NA_integer的核心原因是coronavirus_dataset的cases列存在缺失值,可运行sum(is.na(coronavirus_dataset$cases))查看该列缺失值的具体数量。 - 现有
percent_cases代码存在语法错误:mutate()行结束后的管道符%>%单独放置于下一行,会被R判定为上一行语句执行完毕,直接抛出语法错误。
修复方案
在所有调用sum()的位置添加na.rm = TRUE参数即可忽略缺失值完成求和,同时修正管道符位置即可正常运行,修正后的完整代码如下:
if(!require(pacman)) install.packages("pacman") library(pacman) pacman::p_load(readr, ggplot2, dplyr, coronavirus, knitr) total_cases <- coronavirus_dataset %>% group_by(type, date) %>% summarise(diary_cases = sum(cases, na.rm = TRUE)) %>% arrange(date) %>% mutate(full_cases = cumsum(diary_cases)) total_cases_all = sum(coronavirus_dataset$cases, na.rm = TRUE) percent_cases <- coronavirus_dataset %>% group_by(type) %>% summarise(total_cases = sum(cases, na.rm = TRUE)) %>% mutate(percent_total = round(total_cases / total_cases_all * 100, digits = 2)) %>% arrange(desc(total_cases))
内容的提问来源于stack exchange,提问作者Brot
相关产品推荐
相关产品推荐

