如何对Pandas DataFrame连续同组分段统计行数并新增count列
Pandas 连续同值分组行数统计实现方法
你用普通groupby('col3')得不到预期结果的原因是:这种写法会把所有col3值相同的行合并为同一组,无法区分非连续的同值块(比如示例中前两行的A和最后一行的A,属于两个独立的连续分组,普通groupby会把它们算成同一个组,统计行数为3)。
要实现连续同值分组统计,需要先给每个连续的同值块分配唯一的分组标识,再按这个标识分组统计行数,具体实现如下:
首先修正你示例代码的小问题:col3的A、B是字符串类型,需要加引号,否则运行会报错:
import pandas as pd d = {'col1': [1, 2,0,55,12], 'col2': [3, 4,44,34,46], 'col3': ['A','A','B','B','A'] } df = pd.DataFrame(data=d)
实现代码
写法1(可读性更高,带临时分组列)
# 生成连续分组ID:当前行col3值和上一行不同时标记为新分组,累加后得到每个连续块的唯一ID df['group_id'] = (df['col3'] != df['col3'].shift()).cumsum() # 按分组ID统计每组行数,用transform将统计结果映射到组内每一行 df['count'] = df.groupby('group_id')['col3'].transform('size') # 可选:删除临时生成的group_id列 df.drop('group_id', axis=1, inplace=True)
写法2(简化版,无需临时列)
df['count'] = df.groupby((df['col3'] != df['col3'].shift()).cumsum())['col3'].transform('size')
两种写法运行后得到的结果完全符合你的预期:
col1 col2 col3 count 0 1 3 A 2 1 2 4 A 2 2 0 44 B 2 3 55 34 B 2 4 12 46 A 1
内容的提问来源于stack exchange,提问作者Sara
相关产品推荐
相关产品推荐

