如何在R中对含字符型数字的DataFrame进行正确排序?
字符型数字列的DataFrame排序问题
问题背景
现有如下含字符型列的DataFrame:
df <- data.frame(a=rep("1",4), b=c("10","10","9","9"), c=c("a","a_e","a","a_e"))
输出结构:
a b c 1 1 10 a 2 1 10 a_e 3 1 9 a 4 1 9 a_e
需要按a、b、c列升序排序,且所有列保持字符类型,预期输出为:
expected <- data.frame(a=rep("1",4), b=c("9","9","10","10"), c=c("a","a_e","a","a_e"))
输出结构:
a b c 1 1 9 a 2 1 9 a_e 3 1 10 a 4 1 10 a_e
直接使用dplyr::arrange()无法得到正确结果,因为b列是字符型,排序时按字典序处理,"10"会排在"9"前面:
> df %>% arrange(a,b,c) a b c 1 1 10 a 2 1 10 a_e 3 1 9 a 4 1 9 a_e
简洁解决方案
可以在排序时临时将字符型数字列转换为数值型进行比较,排序完成后原列的字符类型不会改变:
方法1:针对单列处理
直接在arrange中对b列临时转数值型排序:
library(dplyr) df %>% arrange(a, as.numeric(b), c)
方法2:通用化处理(多字符型数字列场景)
如果有多个类似的字符型数字列,可以用across批量处理:
df %>% arrange(a, across(b, ~as.numeric(.)), c) # 若需自动识别所有纯数字字符列排序,可使用: df %>% arrange(across(c(a,b,c), ~ifelse(all(grepl("^\\d+$", .)), as.numeric(.), .)))
以上两种方法都能得到符合预期的排序结果,同时保留所有列的字符类型。
内容的提问来源于stack exchange,提问作者one
相关产品推荐
相关产品推荐

