You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于多列合并Pandas DataFrame重复行并将PKID转为整数列表

解决Pandas中基于多列合并重复行并聚合PKID为整数列表的问题

嘿,这个需求在日常数据处理里挺常见的,用Pandas的分组聚合功能就能轻松搞定!我给你一步步拆解怎么做:

1. 先构造匹配需求的示例数据

假设你的原始DataFrame是这样的(模拟你说的第0、1行除PKID外完全重复的场景):

import pandas as pd

df = pd.DataFrame({
    'PKID': [1, 2, 3, 4],
    'Name': ['Alice', 'Alice', 'Bob', 'Charlie'],
    'Age': [30, 30, 25, 35],
    'City': ['New York', 'New York', 'London', 'Paris']
})

2. 核心处理代码

我们需要以除PKID外的所有列作为判断重复的依据,把这些列分组后,将每个组内的PKID值聚合为整数列表:

方法一:自动排除PKID列(适合列数较多的场景)

如果你的DataFrame列数多,不想手动写分组列名,可以用列表推导式自动生成分组键:

# 生成除PKID外的所有列名作为分组依据
group_columns = [col for col in df.columns if col != 'PKID']
# 分组聚合,as_index=False确保分组列保持为普通列而非索引
result_df = df.groupby(group_columns, as_index=False)['PKID'].agg(list)

方法二:手动指定分组列(更高效,适合明确知道重复判断列的场景)

如果你清楚哪些列是重复判断的核心(比如示例里的Name、Age、City),直接指定列名会更直观高效:

group_columns = ['Name', 'Age', 'City']
result_df = df.groupby(group_columns, as_index=False)['PKID'].agg(list)

3. 最终结果展示

运行代码后,result_df的输出会是这样:

Name  Age      City    PKID
0    Alice   30  New York  [1, 2]
1      Bob   25    London     [3]
2  Charlie   35     Paris     [4]

你看,原本重复的Alice行已经合并成一行,PKID列变成了整数列表[1,2],完全符合你的需求!

额外小提示

  • 如果你希望单个PKID的行保持整数而非列表,可以自定义聚合函数,但通常统一为列表类型会更方便后续的数据处理;
  • 因为你已经明确PKID是整数类型,聚合后的列表元素会自动保留整数属性,不需要额外类型转换。

内容的提问来源于stack exchange,提问作者Shankar Pandey

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 10:37:16