You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于10分钟滚动窗口的Pandas DataFrame列b去重问题

嘿,针对你这个50万行DataFrame的滚动窗口去重需求,循环遍历的方法肯定效率太低,咱们来用Pandas的内置功能搞个更高效的方案。

首先先明确下需求:你要给每一行对应的当前时间之后10分钟内(t0 < index <= t0+10min)的数据,对列b做去重,原来用rolling_apply报错是因为它要求函数返回标量/一维数组,不能直接返回DataFrame。

方案1:获取每个窗口内的唯一b值列表

如果你的目标只是得到每个滚动窗口内的唯一b值(不需要保留对应行的其他数据),可以用滚动窗口结合apply来实现。这里要注意,因为你要的是向后窗口(当前时间之后10分钟),我们可以通过反转DataFrame把它转换成向前窗口处理:

import pandas as pd

# 确保索引是datetime类型(如果还没转换的话)
df.index = pd.to_datetime(df.index)

# 定义函数:提取窗口内唯一的b值,返回一维数组
def get_unique_b(window):
    return window['b'].unique()

# 反转DataFrame,将向后窗口转为向前窗口处理
reversed_df = df.iloc[::-1].copy()
# 设置10分钟滚动窗口,closed='both'确保包含边界时间点
reversed_df['unique_b'] = reversed_df.rolling('10T', closed='both')['b'].apply(get_unique_b, raw=False)
# 再反转回来,得到原DataFrame对应行的向后10分钟窗口唯一b值
df['unique_b'] = reversed_df['unique_b'].iloc[::-1]

这个方法的时间复杂度是O(n)级别的,比循环快得多,完全适配50万行的数据量。

方案2:保留窗口内去重后的完整行

如果你的目标是像循环那样得到每个窗口内去重后的完整行集合,要注意:50万行对应的窗口会产生大量重复数据,内存压力会很大。但我们可以用更高效的方式生成结果,比如用merge_asof替代循环切片:

import pandas as pd

# 生成所有窗口的起始、结束时间及唯一ID
windows_df = pd.DataFrame({
    'start': df.index,
    'end': df.index + pd.Timedelta(minutes=10),
    'window_id': range(len(df))
})

# 用merge_asof高效匹配每个数据行属于哪些窗口(适合有序时间索引)
merged = pd.merge_asof(
    df.reset_index(), 
    windows_df, 
    left_on='index', 
    right_on='start', 
    direction='backward'
)
# 过滤掉不在窗口时间范围内的行
merged = merged[merged['index'] <= merged['end']]

# 按窗口ID分组,对b列去重
result = merged.groupby('window_id').apply(lambda x: x.drop_duplicates(subset='b')).reset_index(drop=True)

这个方法利用Pandas的高效匹配逻辑替代了循环里的逐行切片,性能会比原生循环提升一个量级。

为什么原来的rolling_apply报错

pd.rolling_apply(现在Pandas推荐用df.rolling().apply())要求传入的函数必须返回标量或者一维数组,而你用lambda x:x.drop_duplicates(subset='b')返回的是DataFrame,不符合要求,所以会报错。我们方案1里的函数返回的是一维数组(unique()的结果),就可以正常运行。

内容的提问来源于stack exchange,提问作者DrDamage

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.21 03:57:30