You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在DataFrame中统计连续模式出现次数并生成新列?

解决大型DataFrame连续模式统计问题

针对你5000行的DataFrame,无需循环,用pandas矢量化操作就能高效实现需求,具体步骤如下:

核心思路

通过分组标识把连续的P=1片段划分为独立分组,计算每个分组的长度后,仅在分组的最后一行标注次数,其余行设为0。

完整代码

import numpy as np
import pandas as pd

# 假设你已经生成了标记列P
# df['P'] = np.where((df['val2'] > df['val1']) & (df['val2']> df['val1'].shift(1)),1,0 )

# 1. 生成连续相同P值的分组键:连续相同的P会被分配同一个组号
group_key = df['P'].ne(df['P'].shift()).cumsum()

# 2. 计算每个分组的长度,给组内每行都填充该组的总次数
group_length = df.groupby(group_key)['P'].transform('count')

# 3. 判断是否是连续1分组的最后一行:当前行P=1,且下一行P≠1(最后一行用fillna(0)处理NaN)
is_last_row = (df['P'] == 1) & (df['P'].shift(-1).fillna(0) != 1)

# 4. 生成目标列:符合条件的行填分组长度,其余填0
df['count'] = np.where(is_last_row, group_length, 0)

代码说明

  • df['P'].ne(df['P'].shift()).cumsum():通过判断当前行与上一行P值是否不同,累加生成分组标识,确保连续相同的P值归为同一组。
  • groupby(group_key)['P'].transform('count'):给每个分组的所有行返回该组的总长度,这样连续P=1的片段里每行都能获取到该片段的总次数。
  • is_last_row条件:精准定位连续P=1片段的最后一行,处理了DataFrame最后一行的边界情况。
  • 最终用np.where完成值的填充,完全是矢量化操作,处理5000行数据毫无压力。

内容的提问来源于stack exchange,提问作者dodo_2030

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.10 18:45:39