如何用Pandas实现Excel中基于动态窗口列的股票指数滚动均值?
动态窗口滚动均值的Pandas实现方案
嗨,我明白你要做的是动态窗口大小的滚动均值计算——也就是每一行的窗口长度都存在ma window列里,和Excel里用INDIRECT动态引用单元格区间的逻辑完全对应。Pandas默认的rolling方法是固定窗口,所以得用自定义逻辑来实现,下面一步步来:
1. 先还原你的示例数据
首先我们把你给的Excel数据转换成Pandas DataFrame,方便后续测试:
import pandas as pd data = { 'date': ['2018/3/21', '2018/3/22', '2018/3/23', '2018/3/26', '2018/3/27'], 'close': [4061.0502, 4020.349, 3904.9355, 3879.893, 3913.2689], 'ma window': [None, None, 3, 2, 4] } df = pd.DataFrame(data) df['date'] = pd.to_datetime(df['date']) # 把日期转成datetime格式
2. 实现动态窗口的滚动均值
核心思路是:对每一行,根据ma window的值,取当前行往上数(窗口长度-1)行到当前行的close值计算均值。我们可以用apply方法来逐行处理:
def dynamic_rolling_mean(row, df): window_size = row['ma window'] # 如果窗口大小为空或者无效(比如小于1),返回NaN if pd.isna(window_size) or window_size < 1: return None # 计算起始行的索引:当前行索引 - 窗口大小 + 1 start_idx = row.name - window_size + 1 # 起始索引不能小于0,否则从第0行开始(如果窗口大小超过当前已有的行数) start_idx = max(start_idx, 0) # 取对应的close区间计算均值 return df.loc[start_idx:row.name, 'close'].mean() # 应用函数到每一行,生成ma列 df['ma'] = df.apply(dynamic_rolling_mean, df=df, axis=1)
3. 验证结果是否和Excel一致
我们来核对几个值:
- 第三行(日期2018/3/23):窗口大小3,对应Excel里的
AVERAGE(B2:B4),计算结果是(4061.0502 + 4020.349 + 3904.9355)/3 ≈ 3995.4449,和Pandas计算的结果一致。 - 第四行(日期2018/3/26):窗口大小2,对应
AVERAGE(B4:B5),结果是(3904.9355 + 3879.893)/2 ≈ 3892.4143,也能匹配上。
4. 性能优化小提示
如果你的数据量很大(比如上万行),apply的速度可能会有点慢。这时候可以用numpy的切片来实现,效率更高:
import numpy as np # 先把close转成numpy数组 close_arr = df['close'].values # 用列表推导式逐行计算 df['ma'] = [ np.mean(close_arr[max(i - ws + 1, 0):i+1]) if not pd.isna(ws) and ws >=1 else None for i, ws in enumerate(df['ma window'].values) ]
这个方法会比apply快很多,适合大数据量场景。
内容的提问来源于stack exchange,提问作者Tim
相关产品推荐
相关产品推荐

