You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas中按条件合并时间连续的行?

符合Pandas风格的实现方式

核心思路是通过生成连续同类型且时间衔接的分组标识,再对分组进行聚合操作,完全不需要逐行遍历。

步骤1:构造示例数据

import pandas as pd

df = pd.DataFrame({
    'begin': [1, 3, 7, 9, 15, 17],
    'end': [3, 7, 9, 15, 17, 20],
    'type': ['A', 'A', 'A', 'B', 'B', 'A']
})

步骤2:生成分组键

我们需要标记出每个新分组的起始位置:当当前行的type与上一行不同,或者当前行的begin不等于上一行的end时,视为新组。通过cumsum()累计这些标记,得到每个行对应的分组ID:

# 生成分组标记:满足条件则为1,否则为0
group_flag = (df['type'] != df['type'].shift()) | (df['begin'] != df['end'].shift())
# 累计求和得到分组ID
df['group_id'] = group_flag.cumsum()

步骤3:按分组ID聚合

对每个分组,取begin的最小值、end的最大值,type取组内任意值(因为同组type一致):

result = df.groupby('group_id').agg(
    begin=('begin', 'min'),
    end=('end', 'max'),
    type=('type', 'first')
).reset_index(drop=True)

最终结果

运行后得到的result即为目标DataFrame:

begin  end type
0      1    9    A
1      9   17    B
2     17   20    A

这个方法完全利用Pandas的向量化操作,效率远高于逐行遍历,是最符合Pandas风格的实现。

内容的提问来源于stack exchange,提问作者Tuur

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.21 00:46:09