You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas DataFrame中提取多邮箱字符串中的用户名?

高效提取DataFrame中邮箱的用户名方法

你可以直接利用Pandas的字符串处理能力结合正则表达式,一步完成用户名提取,比拆分再拼接的方法更简洁高效,下面是两种实用方案:

方案一:正则全局替换(最简洁)

直接用str.replace匹配每个邮箱里@及其后面的域名部分,替换为空字符串即可:

import pandas as pd

d = {'Country':'A', 'Email':'123@abc.com,456@def.com,789@ghi.com'}
df = pd.DataFrame(data=d)

# 核心代码
df['Email'] = df['Email'].str.replace(r'@.*?(?=,|$)', '', regex=True)
print(df)

输出结果:

Country          Email
0       A  123,456,789

正则说明:@.*?(?=,|$) 匹配@后直到下一个逗号或字符串结尾的内容,?表示非贪婪匹配,确保每个邮箱的域名都被精准替换。

方案二:提取所有用户名再拼接

如果需要先单独提取每个用户名再处理,可以用str.extractall提取所有符合规则的用户名,再按行拼接:

import pandas as pd

d = {'Country':'A', 'Email':'123@abc.com,456@def.com,789@ghi.com'}
df = pd.DataFrame(data=d)

# 核心代码
df['Email'] = df['Email'].str.extractall(r'([^@,]+)')[0].groupby(level=0).agg(','.join)
print(df)

输出结果和方案一一致。
正则说明:([^@,]+) 匹配所有不包含@和逗号的字符,也就是每个邮箱的用户名部分;extractall会提取所有符合的结果,最后通过groupby按原行索引分组,用agg拼接成逗号分隔的字符串。

这两种方法都避免了循环拆分拼接的繁琐,利用Pandas的矢量化操作,处理大数据量时效率会更高。

内容的提问来源于stack exchange,提问作者PLUTO TEA

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.16 18:01:06