You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何实现Pandas DataFrame按ID分组筛选间隔40天的保留记录?

实现方案

步骤1:数据预处理

确保Date列是datetime格式,你提到数据已经按ID、Date排序,无需额外排序操作:

import pandas as pd

# 转换Date列为datetime类型
df['Date'] = pd.to_datetime(df['Date'])

步骤2:编写分组过滤逻辑

按ID分组后,逐行判断是否符合间隔40天的保留规则:

def filter_by_40d_cycle(group):
    keep_rows = []
    last_kept_date = None
    for _, row in group.iterrows():
        # 首行直接保留,或当前行距离上一次保留日期满40天则保留
        if last_kept_date is None or (row['Date'] - last_kept_date).days >= 40:
            keep_rows.append(True)
            last_kept_date = row['Date']
        else:
            keep_rows.append(False)
    return group[keep_rows]

# 按ID分组应用规则,group_keys=False避免输出额外的分组索引
result_df = df.groupby('ID', group_keys=False).apply(filter_by_40d_cycle)

# 可选:如果需要输出字符串格式的日期,执行下面的转换
# result_df['Date'] = result_df['Date'].dt.strftime('%Y-%m-%d')

结果验证

针对你给出的ID=A的测试数据,上述代码输出结果和你提供的预期完全一致:

IDDate
A2019-01-02
A2019-02-20
A2019-04-17
A2019-06-12

大数据量优化建议

如果你的数据集规模超过10万行,iterrows遍历的效率偏低,可以用pandas的cumsum向量化操作替代循环,逻辑如下:

def vectorized_filter(group):
    # 计算相邻行的日期间隔
    days_diff = group['Date'].diff().dt.days.fillna(0)
    # 累计间隔超过40天的位置作为新的保留起点
    group['cycle_flag'] = (days_diff >= 40).cumsum()
    # 每个周期保留第一行
    return group.drop_duplicates('cycle_flag', keep='first').drop('cycle_flag', axis=1)

result_df = df.groupby('ID', group_keys=False).apply(vectorized_filter)

内容的提问来源于stack exchange,提问作者Adept

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.01 07:39:04