如何正确遍历pandas dataframe实现邮箱与对应链接的无重复匹配输出
回答
问题原因
- 你遍历的是
df_enlaces['CorreoElectronico'].values,同一个邮箱有多少条对应记录,就会触发多少次循环,导致同一个邮箱的全部链接被重复打印多次。 - 直接打印
loc返回的Series对象,会自带索引名、dtype等额外输出,不是你需要的纯内容。
解决方法
方案1:直接逐行遍历(适合仅打印的场景)
直接遍历DataFrame的每一行,每行对应一个邮箱和一个链接,不会出现重复:
for _, row in df_enlaces.iterrows(): print(row['CorreoElectronico'], row['Enlace'])
方案2:按邮箱分组遍历(适合需要按用户批量处理的场景)
如果后续需要对单个用户的所有链接做统一处理,可以先按邮箱分组,再遍历每个组内的链接:
for mail, group in df_enlaces.groupby('CorreoElectronico'): for link in group['Enlace']: print(mail, link)
两种方案都可以得到目标输出。
内容的提问来源于stack exchange,提问作者alb
相关产品推荐
相关产品推荐

