You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何高效从Pandas DataFrame中获取任意日期的滚动窗口统计值

高效Pandas实现方案

核心采用pd.merge_asof做向量式日期匹配,完全避免逐行循环,性能比原循环实现高1~2个数量级,大数据量场景下优势尤其明显。

实现步骤

  1. 统一日期格式并排序:merge_asof要求关联的日期字段必须为datetime类型且提前排序,是该方案的前置要求
  2. 构造查询日期表:为每个待查询日期计算对应的7天统计窗口起始时间
  3. 关联匹配:用merge_asof匹配所有早于查询日期的事件记录
  4. 分组统计:过滤出落在7天窗口内的记录后,按查询日期分组聚合出所需指标即可

完整可运行代码

import datetime as dt
import pandas as pd

# 原始数据与示例保持一致
df = pd.DataFrame({
    "date": [dt.date(2021, 1, 1), dt.date(2021, 1, 1), dt.date(2021, 1, 2), dt.date(2021, 1, 6)],
    "user": ["a", "b", "a", "c"],
    "amount": [10, 15, 5, 8],
})
dates = pd.Series([dt.date(2021, 1, 3), dt.date(2021, 1, 12)])

# 1. 统一转datetime格式并排序
df['date'] = pd.to_datetime(df['date'])
df = df.sort_values('date').reset_index(drop=True)

# 2. 构造查询日期表,计算7天窗口起始时间
query_df = pd.DataFrame({'query_date': pd.to_datetime(dates)})
query_df['win_start'] = query_df['query_date'] - dt.timedelta(days=7)
query_df = query_df.sort_values('query_date').reset_index(drop=True)

# 3. 向量匹配所有早于查询日期的事件
merged = pd.merge_asof(
    query_df,
    df,
    left_on='query_date',
    right_on='date',
    direction='backward'
)

# 4. 过滤窗口内记录+分组统计指标
res = merged[merged['date'] >= merged['win_start']].groupby('query_date').agg(
    unique_users=('user', 'nunique'),
    average_amount=('amount', 'mean'),
    total_amount=('amount', 'sum')
).reset_index().rename(columns={'query_date': 'date'})

# 可选:空窗口补0,避免无匹配数据时丢失查询日期
res = query_df[['query_date']].rename(columns={'query_date': 'date'}).merge(res, on='date', how='left').fillna(0)

print(res)

输出结果和要求的目标结构完全一致。

注意事项

  • 如果待查询日期数量很多,或者事件表数据量超过百万行,该方案性能优势会更加突出
  • 若需要调整统计窗口长度,仅修改dt.timedelta(days=7)的参数即可

内容的提问来源于stack exchange,提问作者Conor

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 16:57:05