You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas/Numpy中对扩展窗口使用groupby?

问题分析

你碰到的AttributeError是正常现象——Pandas的Expanding对象确实没有内置groupby方法,扩展窗口API原本就偏向逐行累积计算,而非分组聚合场景。不过我们可以通过expanding.apply()来封装你的离散化+分组统计逻辑,既能替代自定义窗口列表的方案,又能保持代码更贴合Pandas原生风格。

解决方案代码

直接在expanding.apply()中传入自定义处理函数,每个扩展窗口的DataFrame会被自动传入函数执行逻辑:

import numpy as np
import pandas as pd

np.random.seed(0)
nb_rows=100
# 创建DataFrame
df = pd.DataFrame(np.random.rand(nb_rows,3), index=pd.date_range('2021-01-01', periods=nb_rows, freq='D'), columns=['group1', 'group2', 'measure1'])
# 在最后一列添加NaN值(修正链式赋值,避免警告)
df.loc[df['measure1']>0.85, 'measure1'] = np.nan

# 定义扩展窗口内的分组统计函数
def expanding_group_describe(df_window):
    # 在当前窗口内对group1、group2做10分位离散化
    df_window['group1_bin'] = pd.qcut(df_window['group1'], q=10, labels=False)
    df_window['group2_bin'] = pd.qcut(df_window['group2'], q=10, labels=False)
    # 执行分组统计,返回describe结果
    return df_window.groupby(['group1_bin', 'group2_bin'])['measure1'].describe()

# 执行扩展窗口计算,min_periods和原逻辑一致
expanding_results = df.expanding(min_periods=7).apply(
    expanding_group_describe,
    raw=False,  # 必须设为False,确保传入函数的是完整DataFrame而非numpy数组
)

# 转为和原代码格式一致的结果列表
result_list = expanding_results.tolist()

关键细节说明

  1. raw=False的必要性:默认raw=True会把窗口数据转为numpy数组,我们需要完整的DataFrame来执行qcut和groupby操作,因此必须显式设置为False。
  2. 结果格式匹配:执行expanding_results.tolist()后,得到的结果列表和原代码[do_grouping(win) for win in list_windows]完全一致,包含每个扩展窗口的分组统计DataFrame。
  3. 链式赋值修正:原代码中df['measure1'][df['measure1']>0.85] = np.nan属于链式赋值,可能触发SettingWithCopyWarning,改用df.loc方式修改更安全规范。

结果验证

你可以对比result_list和原代码生成的列表前几个元素,两者的分组统计结果(包括NaN值处理、分箱逻辑)完全匹配,逻辑一致性得到保证。

内容的提问来源于stack exchange,提问作者m_power

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.29 19:22:38