R语言如何使用正则表达式提取下划线分段字符串的指定前缀
R语言指定规则字符串提取实现方案
问题规则
待处理字符串统一格式为[string]_[string+number]_[someinfo],需提取前两部分[string]_[string+number],要求提取片段不计入下划线的字符总长度范围为8-20,无固定单段字符长度。
示例输入:
x = c('XY_ABCD101_12_ACE', 'XZ_ACC122_100_BAN', 'XT_AAEEE100_12345_ABC', 'XKY_BBAAUUU124_100')
期望输出:
c('XY_ABCD101', 'XZ_ACC122', 'XT_AAEEE100', 'XKY_BBAAUUU124')
可用实现方式
1. 基础R无依赖实现(通用场景推荐)
直接用基础包自带的sub()函数做正则替换,不需要加载第三方包,处理长向量效率高:
x1 <- sub("^([A-Za-z]+_[A-Za-z0-9]+)_.+", "\\1", x)
正则逻辑说明:
^锚定字符串开头,避免从中间位置误匹配- 捕获组
([A-Za-z]+_[A-Za-z0-9]+)匹配前两段:第一段为纯字母字符串,第二段为字母+数字混合字符串,中间用下划线连接 _.+匹配第二个下划线及其后所有冗余内容- 替换参数
\\1代表保留第一个捕获组的匹配结果,即需要的目标片段
2. 严格长度校验版本(适合存在异常格式数据的场景)
如果需要严格遵守「不计下划线总长度8-20」的规则,增加正向预查做长度校验,避免不符合长度要求的异常值被误提取:
x1_strict <- sub("^(?=.{9,21}_)([A-Za-z]+_[A-Za-z0-9]+)_.+", "\\1", x, perl = TRUE)
长度校验逻辑:前两段加中间下划线的总长度 = 无下划线字符长度 + 1,因此无下划线长度8对应总长度9、无下划线长度20对应总长度21,(?=.{9,21}_)会预查第二个下划线前的内容长度是否在9-21区间,不符合则不会匹配。
3. stringr包简洁写法(适合tidyverse工作流)
如果日常使用tidyverse系列工具,可以用stringr::str_extract()直接提取目标片段,不需要做替换操作:
library(stringr) x1 <- str_extract(x, "^[A-Za-z]+_[A-Za-z0-9]+(?=_)")
这里用零宽正向断言(?=_)定位第二个下划线的位置,直接提取该位置前符合规则的前两段内容。
结果验证
运行上述任意一种方法后,打印x1均可得到符合预期的结果:
> print(x1) [1] "XY_ABCD101" "XZ_ACC122" "XT_AAEEE100" "XKY_BBAAUUU124"
内容的提问来源于stack exchange,提问作者user177196
相关产品推荐
相关产品推荐

