You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas中实现类SQL的Group By聚合与Having过滤?

用Pandas实现SQL的GROUP BY + HAVING COUNT(*) >1逻辑

需求说明

想要实现的SQL等效逻辑如下:

select column1, column2, count(*)
from table
group by column1, column2
having count(*)>1
order by column1, column2;

尝试的错误代码及问题

尝试使用以下代码处理DataFrame df时触发ValueError:

df[df.groupby(['column1', 'column2']).size()>1]

错误信息

ValueError: Buffer dtype mismatch, expected 'Python object' but got 'long long'.

错误原因:直接用分组后的size()结果(带MultiIndex的Series)作为筛选条件,其索引与原DataFrame不匹配,导致类型兼容问题。

纯Pandas内置功能解决方案

方法1:直接获取聚合结果(对应SQL查询输出)

先分组统计计数,筛选出计数大于1的分组后排序:

# 分组统计并筛选
group_counts = df.groupby(['column1', 'column2']).size().reset_index(name='count')
# 筛选计数>1的分组并排序
result = group_counts[group_counts['count'] > 1].sort_values(['column1', 'column2']).reset_index(drop=True)

方法2:保留原DataFrame中符合条件的所有行

如果需要保留原数据中属于重复分组的所有行,可使用filter()方法:

# 筛选出分组大小>1的所有行
filtered_df = df.groupby(['column1', 'column2']).filter(lambda x: len(x) > 1)
# 若需要再生成聚合统计结果,可在此基础上再次分组
result = filtered_df.groupby(['column1', 'column2']).size().reset_index(name='count').sort_values(['column1', 'column2']).reset_index(drop=True)

方法3:用transform()标记分组大小后筛选

通过transform()给每行添加所在分组的大小,再筛选符合条件的行:

# 给每行标记所在分组的大小
df['group_size'] = df.groupby(['column1', 'column2'])['column1'].transform('size')
# 筛选分组大小>1的行
filtered_df = df[df['group_size'] > 1]
# 生成聚合结果
result = filtered_df.groupby(['column1', 'column2']).size().reset_index(name='count').sort_values(['column1', 'column2']).reset_index(drop=True)

内容的提问来源于stack exchange,提问作者Luis

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.27 21:22:07