You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas中聚合同组字符串及合并CSV同列信息?

嗨,我来帮你搞定这两个问题:

问题1:在Pandas中对同组字符串进行连接或聚合操作

在Pandas里处理同组字符串的聚合,核心思路就是先分组,再把组内的字符串拼接起来。最常用的是groupby()配合agg()或者apply()方法,结合字符串的join来实现,非常直观。

举个实际例子,假设我们有如下DataFrame:

import pandas as pd
df = pd.DataFrame({
    'group': ['A', 'A', 'B', 'B', 'B'],
    'text': ['foo', 'bar', 'baz', 'qux', 'quux']
})

如果要把每组的text列用逗号分隔连接起来,只需要一行代码:

# 使用agg方法
grouped_text = df.groupby('group')['text'].agg(', '.join)
# 或者用apply方法,效果完全一致
grouped_text = df.groupby('group')['text'].apply(', '.join)

如果你的数据里有缺失值(NaN),可以先加上dropna()过滤掉,避免拼接出无效内容:

grouped_text = df.groupby('group')['text'].dropna().agg(', '.join)
问题2:基于CSV的email列合并信息

针对CSV文件中需要基于email列合并其他信息的需求,我们可以按「读取CSV → 分组聚合 → 输出结果」的步骤来处理。

假设你的CSV文件(比如data.csv)内容长这样:

email,role
alice@example.com,backend dev
alice@example.com,python expert
bob@example.com,UX designer

具体操作代码如下:

# 1. 读取CSV文件到DataFrame
df = pd.read_csv('data.csv')

# 2. 按email分组,把同一email对应的role用分号分隔合并
merged_df = df.groupby('email')['role'].agg('; '.join).reset_index()

# 3. 把合并后的结果保存回新的CSV文件
merged_df.to_csv('merged_data.csv', index=False)

这里的reset_index()是为了把分组后的email从索引变回普通列,让输出的CSV结构更规整。

另外,要感谢用户coldspeed提供的可行解决方案,上面的实现思路正是参考了他的核心方法优化而来的。


内容的提问来源于stack exchange,提问作者timelfelt

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 09:08:00