R语言中对含Wave字段的数据框按数字升序排序及NA警告解决
我的数据框中Wave字段格式为“Wave X - 日期”,需要按Wave后的数字(2到31)升序排列。
最初生成数据框的代码:
mean_values <- Trial %>% group_by(Wave) %>% summarise(mean_B = mean(Weight_Answer, na.rm = TRUE))
但数据没有按数字自动排序,于是尝试添加排序代码:
mean_values <- Trial %>% group_by(Wave) %>% summarise(mean_B = mean(Weight_Answer, na.rm = TRUE)) %>% arrange(as.numeric(gsub("Wave ", "", Wave)))
运行后出现警告:
Warning message:
There was 1 warning inarrange().
ℹ In argument:..1 = as.numeric(gsub("Wave ", "", Wave)).
Caused by warning:
! NAs introduced by coercion
警告原因
这个警告的意思是:用gsub("Wave ", "", Wave)处理Wave字段后,得到的字符串包含非数字内容(比如“X - 日期”里的“ - 日期”部分),把这些字符串转成数字时,无法转换的部分就变成了NA,arrange函数遇到NA值就会抛出这个警告。
解决办法
核心是精准提取Wave字段里的数字部分,下面提供两种可行方案:
方案1:用stringr包提取数字
先确保安装并加载stringr包,用str_extract直接匹配字符串中的连续数字:
library(dplyr) library(stringr) mean_values <- Trial %>% group_by(Wave) %>% summarise(mean_B = mean(Weight_Answer, na.rm = TRUE)) %>% arrange(as.numeric(str_extract(Wave, "\\d+")))
str_extract(Wave, "\\d+")会从“Wave X - 日期”中提取出纯数字X,转换为数值后就能正常排序。
方案2:用base R正则提取数字
如果不想额外加载包,用sub配合正则表达式捕获数字部分:
mean_values <- Trial %>% group_by(Wave) %>% summarise(mean_B = mean(Weight_Answer, na.rm = TRUE)) %>% arrange(as.numeric(sub("Wave (\\d+) - .*", "\\1", Wave)))
正则表达式"Wave (\\d+) - .*"会匹配整个Wave字符串,并用\\1提取出括号内的数字部分,转换为数值后即可正确排序。
验证方法
可以先检查提取的数字是否存在NA,确认没问题后再排序:
# 用方案1的方法验证 mean_values %>% mutate(wave_num = as.numeric(str_extract(Wave, "\\d+"))) %>% pull(wave_num)
如果输出全是数字没有NA,说明提取成功,排序就不会再出现警告。
内容的提问来源于stack exchange,提问作者Connor McMullan

