You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何基于月度滑动窗口生成保留原数据的DataFrame子集?

按月度实现“弃旧加新”滚动窗口的原始数据子集生成

这个需求其实很常见,咱们可以绕开rolling的聚合逻辑,直接按月份维度手动筛选,完美保留所有原始行数据。下面是具体的实现步骤和代码:

1. 先构造/处理你的原始DataFrame

首先确保你的datetime索引是可以按月份识别的(如果原本是datetime格式,转成月度周期会更方便):

import pandas as pd

# 构造你提供的示例数据
data = {'A': [1, 2, 3, 4, 5, 6, 7, 8]}
dates = pd.to_datetime(['2020-01', '2020-01', '2020-02', '2020-02', 
                        '2020-03', '2020-03', '2020-04', '2020-04'])
df = pd.DataFrame(data, index=dates)

# 将索引转换为月度周期格式(方便后续按月份筛选)
df.index = df.index.to_period('M')

2. 提取唯一月份并生成滚动子集

核心思路是:先拿到所有不重复的月份,然后循环遍历每个月份,每次取当前月份和下一个月份的所有数据,实现“弃旧加新”的滚动效果:

# 获取所有唯一的月份并排序(确保顺序正确)
unique_months = df.index.unique().sort_values()

# 用字典存储生成的各个DataFrame(比动态创建变量更规范易维护)
rolling_dataframes = {}

# 循环生成每个滚动窗口(窗口大小为2个月,循环次数为总月份数-1)
for idx in range(len(unique_months) - 1):
    # 取当前窗口的两个连续月份
    month1 = unique_months[idx]
    month2 = unique_months[idx + 1]
    
    # 筛选这两个月份的所有原始数据
    subset_df = df[(df.index == month1) | (df.index == month2)]
    
    # 存入字典,命名为dataframe1、dataframe2...
    rolling_dataframes[f'dataframe{idx + 1}'] = subset_df

3. 查看结果

现在你可以通过字典键来调用每个子集:

# 查看第一个子集(2020-01和2020-02的数据)
print(rolling_dataframes['dataframe1'])

# 查看第二个子集(2020-02和2020-03的数据)
print(rolling_dataframes['dataframe2'])

为什么不用rolling?

rolling方法本质是做聚合计算(比如求和、均值),它会把窗口内的数据压缩成单个值,而你需要保留原始的每一行数据,所以手动按月份筛选是更直接的方案。

如果你的原始索引是datetime格式(不是月度周期),也可以用df.index.strftime('%Y-%m')来提取年月字符串,再按字符串筛选,效果是一样的。

内容的提问来源于stack exchange,提问作者Jack_T

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.08 16:57:51