You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用正则表达式筛选并处理含6位数字ID的数据行

解决方案

方法一:基础R实现

先筛选符合要求的数据行,再提取id的前6位数字:

# 原始数据集
mydat <- data.frame(id = c("372303", "KN5232", "231244", "283472-3822"),
                    name = c("Adam", "Jane", "TJ", "Joyce"))

# 筛选符合条件的行:6位纯数字 或 6位数字+连字符+4位数字
valid_ids <- grepl("^[0-9]{6}(-[0-9]{4})?$", mydat$id)
mydat_filtered <- mydat[valid_ids, ]

# 提取id的前6位数字
mydat_filtered$id <- substr(mydat_filtered$id, 1, 6)

# 查看最终结果
mydat_filtered

运行后输出:

id  name
1 372303  Adam
3 231244    TJ
4 283472 Joyce

方法二:正则替换简化步骤

用sub函数直接提取前6位,同时完成筛选:

# 筛选并处理id
mydat2 <- mydat[grepl("^[0-9]{6}(-[0-9]{4})?$", mydat$id), ]
mydat2$id <- sub("^([0-9]{6}).*$", "\\1", mydat2$id)

# 输出结果
mydat2

原方法失效原因

你之前用的grep("^[0-9]{6}$", ...)只匹配恰好6位纯数字的字符串,带连字符的283472-3822长度超过6位,不符合该正则的匹配规则,因此被排除,无法满足需求。

内容的提问来源于stack exchange,提问作者Adrian

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.21 20:27:31