如何解决tidyr::separate函数拆分时数据错位及丢失问题
解决字符串拆分时的内容错位问题
你的代码出现警告和结果错位的原因是:gsub('([[:upper:]])', ' \\1', ab)会给所有大写字母前添加空格,包括字符串的第一个字符。比如原字符串是Y3D4.6,处理后变成 Y3 D4.6,开头多了一个空格。用separate按空格拆分时,第一个分割出的是空字符串,第二个是Y3,而后面的D4.6因为指定了只分成a和b两列,被直接丢弃,最终导致预期的内容错位、部分内容丢失。
修正后的代码
调整正则表达式,仅在非字符串开头的大写字母前添加空格:
set.seed(1) # 创建需要拆分的融合字符串数据框 df1 <- as.data.frame(matrix( paste0(sample(LETTERS, 20, replace = TRUE), sample(seq(1, 7, 0.1), 20, replace = TRUE)), nrow = 10)) %>% unite(col = "ab", sep = "") # 仅在非开头的大写字母前添加空格(使用Perl风格正则) df2 <- df1 %>% mutate(ab = gsub('(?<!^)([[:upper:]])', ' \\1', ab, perl = TRUE)) # 拆分列 df3 <- df2 %>% separate(col=ab, into=c("a", "b"), sep = " ") df3
关键说明
正则表达式(?<!^)([[:upper:]])中的(?<!^)是负向零宽断言,用于匹配不是字符串开头的位置,这样只会给第二个及以后的大写字母前加空格。处理后的字符串会变成Y3 D4.6的格式,separate拆分后正好将第一个字母数字组合存入a列,第二个存入b列,不会出现警告和内容丢失的问题。
内容的提问来源于stack exchange,提问作者rainbird
相关产品推荐
相关产品推荐

