如何按img列分组合并DataFrame中的列表列?现有代码失效
问题描述
我有一个DataFrame,包含以下数据:
| img | list_col1 | list_col2 | |------|--------------|-----------------------------| | img1 | [str1] | [[list1], [list2]] | | img1 | [str2, str3] | [[list3], [list4]] | | img2 | [str3] | [[list5], [list6], [list7]] |
希望按img列分组后得到如下结果:
| img | list_col1 | list_col2 | |------|--------------------|--------------------------------------| | img1 | [str1, str2, str3] | [[list1], [list2], [list3], [list4]] | | img2 | [str3] | [[list5], [list6], [list7]] |
尝试了以下代码但无法正常运行:
grouped_df = temp_df.groupby(['img'])[['list_col1', 'list_col2']].apply(list)
需要正确的实现方法。
解决方法
要实现分组后拼接列表列的需求,核心是对每个分组内的列表进行拼接操作,而非直接转成list。以下两种方法都可以实现:
方法1:自定义拼接函数+agg
def concat_lists(series): # 遍历分组内的每个子列表,拼接成一个大列表 return [item for sublist in series for item in sublist] # 按img分组,对指定列应用拼接函数 grouped_df = temp_df.groupby('img').agg({ 'list_col1': concat_lists, 'list_col2': concat_lists }).reset_index()
方法2:直接使用sum(更简洁)
列表的sum操作会自动将多个列表拼接为一个,刚好匹配需求,无需自定义函数:
grouped_df = temp_df.groupby('img').agg({ 'list_col1': sum, 'list_col2': sum }).reset_index()
说明
- 对于
list_col2这类嵌套列表,sum只会拼接最外层的列表,不会扁平化内部的子列表,完全符合你要的结果。 - 调用
reset_index()是为了将img从分组索引重新转为普通列,和示例结果的结构一致。
内容的提问来源于stack exchange,提问作者Yana
相关产品推荐
相关产品推荐

