求助:如何统一R语言DataFrame中下划线前后字符串的顺序
解决方法
你不需要遍历所有组合,利用向量化函数就能高效统一字符串顺序,核心思路是对下划线拆分后的两部分按字典序排序,再重新合并:
基础R实现
# 拆分S列为两部分(替代你原来的lapply写法,更高效) split_parts <- do.call(rbind, strsplit(df$S, "_")) df$L1 <- split_parts[, 1] df$L2 <- split_parts[, 2] # 生成统一顺序的字符串列 df$unified_S <- paste(pmin(df$L1, df$L2), pmax(df$L1, df$L2), sep = "_")
tidyverse实现(更简洁)
如果你习惯用tidyverse工具链,可以这样写:
library(dplyr) library(tidyr) df <- df %>% # 拆分S列为L1、L2,保留原S列 separate(S, into = c("L1", "L2"), sep = "_", remove = FALSE) %>% # 按字典序排序后合并 mutate(unified_S = paste(pmin(L1, L2), pmax(L1, L2), sep = "_"))
效果说明
pmin()和pmax()会逐行比较L1和L2的字符串,取字典序更小的作为前半部分,更大的作为后半部分- 示例中原来的
B_A会被统一为A_B,和原有的A_B格式一致;其他如F_G保持不变,因为F字典序小于G
这种方法是向量化操作,处理6000条数据毫无压力,比循环遍历高效得多。
内容的提问来源于stack exchange,提问作者pingu87
相关产品推荐
相关产品推荐

