You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Oracle中如何检索相似重复数据?附示例表说明

在Oracle中检索相似重复记录的方法

嘿,这个场景在数据清洗或者去重预处理里太常见了!针对你给出的示例表,我们可以通过提取名称的核心匹配部分,再分组筛选出存在多条匹配的记录。下面给你两种直接能用的Oracle实现方案:

方法一:提取纯字母核心名称

这个方法会把名称里所有非字母的字符(数字、下划线等)都去掉,以此作为分组依据,找出共享同一核心名称的重复记录:

WITH name_groups AS (
    SELECT 
        id,
        name,
        -- 移除所有非字母字符,得到核心名称
        REGEXP_REPLACE(name, '[^A-Za-z]', '') AS core_name
    FROM your_table_name -- 替换成你的实际表名
)
SELECT id, name
FROM name_groups
WHERE core_name IN (
    -- 找出核心名称出现多次的分组
    SELECT core_name
    FROM name_groups
    GROUP BY core_name
    HAVING COUNT(*) > 1
)
ORDER BY core_name, name;

运行这个查询后,你会得到所有和Matt、Joseph相关的相似记录,因为它们的纯字母核心是一致的。

方法二:匹配开头的连续字母序列

如果你的相似规则是「核心字母在前,后面跟着数字/下划线」(比如5Joseph是Joseph的变体,Matt_43是Matt的变体),可以用正则匹配开头的连续字母作为核心:

WITH name_groups AS (
    SELECT 
        id,
        name,
        -- 提取名称开头的连续字母作为核心
        REGEXP_SUBSTR(name, '^[A-Za-z]+') AS core_name
    FROM your_table_name -- 替换成你的实际表名
)
SELECT id, name
FROM name_groups
WHERE core_name IN (
    SELECT core_name
    FROM name_groups
    GROUP BY core_name
    HAVING COUNT(*) > 1
)
ORDER BY core_name, name;

这个方法更精准对应你的示例场景:5Joseph会被提取出Joseph,Matt1提取出Matt,完美筛选出你要的相似重复项。

小提示

如果你的相似规则有变化(比如核心允许包含下划线),只需要调整正则表达式即可。比如要保留下划线只去掉数字,就把[^A-Za-z]改成[^A-Za-z_],灵活调整就能适配不同场景。

内容的提问来源于stack exchange,提问作者Shubham Sharan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.15 07:42:19