如何在Pandas中按office分组后提取salary列的唯一逗号分隔值
问题
我有如下DataFrame:
office salary 0 Montreal a,b 1 Montreal b,c,d 2 Montreal b,c,d 3 Montreal c,d,e 4 Toronto n,c
期望输出:
office salary 0 Montreal a,b,c,d,e 1 Toronto b,c,d,n,c
我尝试了以下代码,但结果不符合预期:
import pandas as pd import numpy as np office = ['Montreal', 'Montreal', 'Montreal', 'Montreal','Toronto'] avg_salary = ["a,b","b,c,d","b,c,d","c,d,e","n,c"] hr_lst = list(zip(office, avg_salary)) df = pd.DataFrame(hr_lst, columns = ['office', 'salary']) print("Created DataFrame:\n",df,"\n") # 尝试的去重代码 res = df.groupby('office')['salary'].apply(lambda x: list(np.unique(x))) print("Unique Values:\n",res)
得到的输出是:
Unique Values: office Montreal [a,b, b,c,d, c,d,e] Toronto [b,c,d, n,c] Name: salary, dtype: object
问题在于当前代码只是对整个salary字符串去重,没有拆分每个字符串里的逗号分隔元素,再合并去重后重新拼接。
解决方法
要实现需求,需要先把每个salary字段的逗号分隔值拆分成单个元素,然后按office分组,收集所有元素并去重,最后再用逗号连接成字符串。可以通过以下两种方式实现:
方法一:利用str.split+explode展开后分组聚合
import pandas as pd # 构造原始DataFrame office = ['Montreal', 'Montreal', 'Montreal', 'Montreal','Toronto'] avg_salary = ["a,b","b,c,d","b,c,d","c,d,e","n,c"] df = pd.DataFrame(list(zip(office, avg_salary)), columns=['office', 'salary']) # 1. 拆分salary列的逗号分隔值,展开成单行单个元素 df['salary'] = df['salary'].str.split(',') df_exploded = df.explode('salary') # 2. 按office分组,去重后拼接成逗号分隔的字符串 result = df_exploded.groupby('office')['salary'].agg(lambda x: ','.join(pd.unique(x))).reset_index() print(result)
方法二:直接在groupby的apply中处理
如果不想生成中间表,可以直接在分组后的apply里完成拆分、合并、去重、拼接:
import pandas as pd # 构造原始DataFrame office = ['Montreal', 'Montreal', 'Montreal', 'Montreal','Toronto'] avg_salary = ["a,b","b,c,d","b,c,d","c,d,e","n,c"] df = pd.DataFrame(list(zip(office, avg_salary)), columns=['office', 'salary']) # 分组后处理每个组的salary列 result = df.groupby('office')['salary'].apply( lambda x: ','.join(pd.unique(','.join(x).split(','))) ).reset_index() print(result)
两种方法都会得到符合预期的输出(注:去重后的元素顺序可能因Pandas版本略有不同,若需要严格保持元素首次出现的顺序,可将pd.unique替换为dict.fromkeys(目标列表).keys()来保留顺序)。
内容的提问来源于stack exchange,提问作者Rohit Laxman Bhojane
相关产品推荐
相关产品推荐

