Oracle中如何检索相似重复数据?附示例表说明
在Oracle中检索相似重复记录的方法
嘿,这个场景在数据清洗或者去重预处理里太常见了!针对你给出的示例表,我们可以通过提取名称的核心匹配部分,再分组筛选出存在多条匹配的记录。下面给你两种直接能用的Oracle实现方案:
方法一:提取纯字母核心名称
这个方法会把名称里所有非字母的字符(数字、下划线等)都去掉,以此作为分组依据,找出共享同一核心名称的重复记录:
WITH name_groups AS ( SELECT id, name, -- 移除所有非字母字符,得到核心名称 REGEXP_REPLACE(name, '[^A-Za-z]', '') AS core_name FROM your_table_name -- 替换成你的实际表名 ) SELECT id, name FROM name_groups WHERE core_name IN ( -- 找出核心名称出现多次的分组 SELECT core_name FROM name_groups GROUP BY core_name HAVING COUNT(*) > 1 ) ORDER BY core_name, name;
运行这个查询后,你会得到所有和Matt、Joseph相关的相似记录,因为它们的纯字母核心是一致的。
方法二:匹配开头的连续字母序列
如果你的相似规则是「核心字母在前,后面跟着数字/下划线」(比如5Joseph是Joseph的变体,Matt_43是Matt的变体),可以用正则匹配开头的连续字母作为核心:
WITH name_groups AS ( SELECT id, name, -- 提取名称开头的连续字母作为核心 REGEXP_SUBSTR(name, '^[A-Za-z]+') AS core_name FROM your_table_name -- 替换成你的实际表名 ) SELECT id, name FROM name_groups WHERE core_name IN ( SELECT core_name FROM name_groups GROUP BY core_name HAVING COUNT(*) > 1 ) ORDER BY core_name, name;
这个方法更精准对应你的示例场景:5Joseph会被提取出Joseph,Matt1提取出Matt,完美筛选出你要的相似重复项。
小提示
如果你的相似规则有变化(比如核心允许包含下划线),只需要调整正则表达式即可。比如要保留下划线只去掉数字,就把[^A-Za-z]改成[^A-Za-z_],灵活调整就能适配不同场景。
内容的提问来源于stack exchange,提问作者Shubham Sharan
相关产品推荐
相关产品推荐

