You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas中按office分组后提取salary列的唯一逗号分隔值

问题

我有如下DataFrame:

office    salary
0  Montreal     a,b
1  Montreal   b,c,d
2  Montreal   b,c,d
3  Montreal   c,d,e
4   Toronto     n,c

期望输出:

office        salary
0  Montreal  a,b,c,d,e
1   Toronto  b,c,d,n,c

我尝试了以下代码,但结果不符合预期:

import pandas as pd
import numpy as np

office = ['Montreal', 'Montreal', 'Montreal', 'Montreal','Toronto']
avg_salary = ["a,b","b,c,d","b,c,d","c,d,e","n,c"]
hr_lst  = list(zip(office, avg_salary))

df = pd.DataFrame(hr_lst, columns = ['office', 'salary'])

print("Created DataFrame:\n",df,"\n")

# 尝试的去重代码
res = df.groupby('office')['salary'].apply(lambda x: list(np.unique(x)))

print("Unique Values:\n",res)

得到的输出是:

Unique Values:
 office
Montreal    [a,b, b,c,d, c,d,e]
Toronto            [b,c,d, n,c]
Name: salary, dtype: object

问题在于当前代码只是对整个salary字符串去重,没有拆分每个字符串里的逗号分隔元素,再合并去重后重新拼接。

解决方法

要实现需求,需要先把每个salary字段的逗号分隔值拆分成单个元素,然后按office分组,收集所有元素并去重,最后再用逗号连接成字符串。可以通过以下两种方式实现:

方法一:利用str.split+explode展开后分组聚合

import pandas as pd

# 构造原始DataFrame
office = ['Montreal', 'Montreal', 'Montreal', 'Montreal','Toronto']
avg_salary = ["a,b","b,c,d","b,c,d","c,d,e","n,c"]
df = pd.DataFrame(list(zip(office, avg_salary)), columns=['office', 'salary'])

# 1. 拆分salary列的逗号分隔值,展开成单行单个元素
df['salary'] = df['salary'].str.split(',')
df_exploded = df.explode('salary')

# 2. 按office分组,去重后拼接成逗号分隔的字符串
result = df_exploded.groupby('office')['salary'].agg(lambda x: ','.join(pd.unique(x))).reset_index()

print(result)

方法二:直接在groupby的apply中处理

如果不想生成中间表,可以直接在分组后的apply里完成拆分、合并、去重、拼接:

import pandas as pd

# 构造原始DataFrame
office = ['Montreal', 'Montreal', 'Montreal', 'Montreal','Toronto']
avg_salary = ["a,b","b,c,d","b,c,d","c,d,e","n,c"]
df = pd.DataFrame(list(zip(office, avg_salary)), columns=['office', 'salary'])

# 分组后处理每个组的salary列
result = df.groupby('office')['salary'].apply(
    lambda x: ','.join(pd.unique(','.join(x).split(',')))
).reset_index()

print(result)

两种方法都会得到符合预期的输出(注:去重后的元素顺序可能因Pandas版本略有不同,若需要严格保持元素首次出现的顺序,可将pd.unique替换为dict.fromkeys(目标列表).keys()来保留顺序)。

内容的提问来源于stack exchange,提问作者Rohit Laxman Bhojane

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.14 09:05:25