使用正则表达式筛选并处理含6位数字ID的数据行
解决方案
方法一:基础R实现
先筛选符合要求的数据行,再提取id的前6位数字:
# 原始数据集 mydat <- data.frame(id = c("372303", "KN5232", "231244", "283472-3822"), name = c("Adam", "Jane", "TJ", "Joyce")) # 筛选符合条件的行:6位纯数字 或 6位数字+连字符+4位数字 valid_ids <- grepl("^[0-9]{6}(-[0-9]{4})?$", mydat$id) mydat_filtered <- mydat[valid_ids, ] # 提取id的前6位数字 mydat_filtered$id <- substr(mydat_filtered$id, 1, 6) # 查看最终结果 mydat_filtered
运行后输出:
id name 1 372303 Adam 3 231244 TJ 4 283472 Joyce
方法二:正则替换简化步骤
用sub函数直接提取前6位,同时完成筛选:
# 筛选并处理id mydat2 <- mydat[grepl("^[0-9]{6}(-[0-9]{4})?$", mydat$id), ] mydat2$id <- sub("^([0-9]{6}).*$", "\\1", mydat2$id) # 输出结果 mydat2
原方法失效原因
你之前用的grep("^[0-9]{6}$", ...)只匹配恰好6位纯数字的字符串,带连字符的283472-3822长度超过6位,不符合该正则的匹配规则,因此被排除,无法满足需求。
内容的提问来源于stack exchange,提问作者Adrian
相关产品推荐
相关产品推荐

