You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

关于Pandas滚动窗口求和结果随序列长度不一致的技术问询

Pandas滚动求和中序列长度引发的浮点精度差异原因

你观察到的现象本质是浮点运算的累积误差结合Pandas滚动窗口的性能优化实现导致的,并非逻辑错误。

核心原因:滚动求和的两种计算路径

Pandas为了提升长序列滚动运算的性能,对滚动求和采用了增量式滑动更新,而短序列的滚动求和则是直接计算窗口内元素的和,两种计算方式的浮点误差累积程度不同,最终产生微小差异:

  1. 长序列的增量计算逻辑
    对于s1这类较长的序列,滚动求和不会每次重新计算窗口内所有元素的和,而是通过「减去窗口左端移出的元素,加上窗口右端新加入的元素」来更新结果:

    # 以s1*0.1的滚动求和为例:
    # 窗口index0-1: 0.0 + 0.1 = 0.1
    # 窗口index1-2: 0.1 - 0.0 + 0.2 = 0.3
    # 窗口index2-3: 0.3 - 0.1 + 0.3 = 0.5 (基于前一步结果计算,误差累积)
    # 窗口index3-4: 0.5 - 0.2 + 0.4 = 0.7
    

    每一步计算都依赖前一步的结果,浮点误差会逐步累积。

  2. 短序列的直接求和逻辑
    对于s2这类短序列,Pandas会直接计算每个窗口内元素的和:

    # 以s2*0.1的滚动求和为例:
    # 窗口index2-3: 0.2 + 0.3 = 0.5 (仅单次加法,误差来自单次运算)
    # 窗口index3-4: 0.3 + 0.4 = 0.7
    

    这种方式的误差是单次运算的舍入误差,和增量计算的累积误差存在微小差异。

浮点数的本质局限性

另外,0.1这类十进制小数无法精确表示为二进制浮点数,这是所有浮点运算误差的根源。每次加减操作都会引入微小的舍入误差,增量计算会把这些误差逐步累积,最终导致和直接计算的结果出现可检测的差异。

验证方式

如果直接对s1的对应窗口重新求和,结果会和s2的结果一致:

# 直接计算s1窗口index2-3的和
direct_sum = (s1.loc[2:3] * 0.1).sum()
# 该值与r2.iloc[0]的误差远小于增量计算的结果

内容的提问来源于stack exchange,提问作者lukstei

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.18 03:15:19