如何在Pandas DataFrame中提取多邮箱字符串中的用户名?
高效提取DataFrame中邮箱的用户名方法
你可以直接利用Pandas的字符串处理能力结合正则表达式,一步完成用户名提取,比拆分再拼接的方法更简洁高效,下面是两种实用方案:
方案一:正则全局替换(最简洁)
直接用str.replace匹配每个邮箱里@及其后面的域名部分,替换为空字符串即可:
import pandas as pd d = {'Country':'A', 'Email':'123@abc.com,456@def.com,789@ghi.com'} df = pd.DataFrame(data=d) # 核心代码 df['Email'] = df['Email'].str.replace(r'@.*?(?=,|$)', '', regex=True) print(df)
输出结果:
Country Email 0 A 123,456,789
正则说明:@.*?(?=,|$) 匹配@后直到下一个逗号或字符串结尾的内容,?表示非贪婪匹配,确保每个邮箱的域名都被精准替换。
方案二:提取所有用户名再拼接
如果需要先单独提取每个用户名再处理,可以用str.extractall提取所有符合规则的用户名,再按行拼接:
import pandas as pd d = {'Country':'A', 'Email':'123@abc.com,456@def.com,789@ghi.com'} df = pd.DataFrame(data=d) # 核心代码 df['Email'] = df['Email'].str.extractall(r'([^@,]+)')[0].groupby(level=0).agg(','.join) print(df)
输出结果和方案一一致。
正则说明:([^@,]+) 匹配所有不包含@和逗号的字符,也就是每个邮箱的用户名部分;extractall会提取所有符合的结果,最后通过groupby按原行索引分组,用agg拼接成逗号分隔的字符串。
这两种方法都避免了循环拆分拼接的繁琐,利用Pandas的矢量化操作,处理大数据量时效率会更高。
内容的提问来源于stack exchange,提问作者PLUTO TEA
相关产品推荐
相关产品推荐

