You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas:修正DataFrame中键的拼写错误,合并重复客户唯一键

解决同一手机号客户因邮箱拼写错误导致重复键的问题

我来帮你搞定这个问题!核心思路是先从每个Key里提取手机号前缀作为分组依据,然后把同一分组内的所有Key统一替换成该组的第一个Key,具体步骤如下:

1. 准备示例数据(模拟你的场景)

首先我们先构造一个和你描述一致的DataFrame,方便演示:

import pandas as pd

data = {
    'Key': ['555261andymiller@gmail.com', '555261andymller@gmail.com', '789123sarahjones@yahoo.com', '789123sarahjoness@yahoo.com'],
    'Order #': [901345, 901345, 678901, 678901]
}
df = pd.DataFrame(data)

2. 提取手机号前缀作为分组键

因为你的Key是手机号(数字前缀)+邮箱的组合,我们用正则表达式提取Key开头的所有数字作为分组标识:

# 提取Key开头的数字部分作为手机号前缀
df['phone_prefix'] = df['Key'].str.extract(r'^(\d+)', expand=False)

这一步会生成一个临时列phone_prefix,值就是每个Key对应的手机号(比如555261、789123)。

3. 统一分组内的Key值

通过groupby按手机号前缀分组,然后用transform('first')把组内所有行的Key替换成该组的第一个Key:

# 将每组的Key统一替换为该组的第一个Key
df['Key'] = df.groupby('phone_prefix')['Key'].transform('first')

4. 清理临时列(可选)

如果不需要保留phone_prefix列,可以删掉它:

df = df.drop('phone_prefix', axis=1)

最终效果

处理后的DataFrame会变成这样:

KeyOrder #
555261andymiller@gmail.com901345
555261andymiller@gmail.com901345
789123sarahjones@yahoo.com678901
789123sarahjones@yahoo.com678901

这样就完美解决了邮箱拼写错误导致的同一客户多个键的问题!

内容的提问来源于stack exchange,提问作者DerivativeIntegral

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.25 06:27:55