You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何对Pandas DataFrame连续同组分段统计行数并新增count列

Pandas 连续同值分组行数统计实现方法

你用普通groupby('col3')得不到预期结果的原因是:这种写法会把所有col3值相同的行合并为同一组,无法区分非连续的同值块(比如示例中前两行的A和最后一行的A,属于两个独立的连续分组,普通groupby会把它们算成同一个组,统计行数为3)。

要实现连续同值分组统计,需要先给每个连续的同值块分配唯一的分组标识,再按这个标识分组统计行数,具体实现如下:

首先修正你示例代码的小问题:col3的A、B是字符串类型,需要加引号,否则运行会报错:

import pandas as pd
d = {'col1': [1, 2,0,55,12], 'col2': [3, 4,44,34,46], 'col3': ['A','A','B','B','A'] } 
df = pd.DataFrame(data=d)

实现代码

写法1(可读性更高,带临时分组列)

# 生成连续分组ID:当前行col3值和上一行不同时标记为新分组,累加后得到每个连续块的唯一ID
df['group_id'] = (df['col3'] != df['col3'].shift()).cumsum()
# 按分组ID统计每组行数,用transform将统计结果映射到组内每一行
df['count'] = df.groupby('group_id')['col3'].transform('size')
# 可选:删除临时生成的group_id列
df.drop('group_id', axis=1, inplace=True)

写法2(简化版,无需临时列)

df['count'] = df.groupby((df['col3'] != df['col3'].shift()).cumsum())['col3'].transform('size')

两种写法运行后得到的结果完全符合你的预期:

col1  col2 col3  count
0     1     3    A      2
1     2     4    A      2
2     0    44    B      2
3    55    34    B      2
4    12    46    A      1

内容的提问来源于stack exchange,提问作者Sara

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.23 20:54:02