You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何按img列分组合并DataFrame中的列表列?现有代码失效

问题描述

我有一个DataFrame,包含以下数据:

| img  |  list_col1   |          list_col2          |
|------|--------------|-----------------------------|
| img1 | [str1]       | [[list1], [list2]]          |
| img1 | [str2, str3] | [[list3], [list4]]          |
| img2 | [str3]       | [[list5], [list6], [list7]] |

希望按img列分组后得到如下结果:

| img  |     list_col1      |              list_col2               |
|------|--------------------|--------------------------------------|
| img1 | [str1, str2, str3] | [[list1], [list2], [list3], [list4]] |
| img2 | [str3]             | [[list5], [list6], [list7]]          |

尝试了以下代码但无法正常运行:

grouped_df = temp_df.groupby(['img'])[['list_col1', 'list_col2']].apply(list)

需要正确的实现方法。

解决方法

要实现分组后拼接列表列的需求,核心是对每个分组内的列表进行拼接操作,而非直接转成list。以下两种方法都可以实现:

方法1:自定义拼接函数+agg

def concat_lists(series):
    # 遍历分组内的每个子列表,拼接成一个大列表
    return [item for sublist in series for item in sublist]

# 按img分组,对指定列应用拼接函数
grouped_df = temp_df.groupby('img').agg({
    'list_col1': concat_lists,
    'list_col2': concat_lists
}).reset_index()

方法2:直接使用sum(更简洁)

列表的sum操作会自动将多个列表拼接为一个,刚好匹配需求,无需自定义函数:

grouped_df = temp_df.groupby('img').agg({
    'list_col1': sum,
    'list_col2': sum
}).reset_index()

说明

  • 对于list_col2这类嵌套列表,sum只会拼接最外层的列表,不会扁平化内部的子列表,完全符合你要的结果。
  • 调用reset_index()是为了将img从分组索引重新转为普通列,和示例结果的结构一致。

内容的提问来源于stack exchange,提问作者Yana

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.24 00:42:12