基于10分钟滚动窗口的Pandas DataFrame列b去重问题
嘿,针对你这个50万行DataFrame的滚动窗口去重需求,循环遍历的方法肯定效率太低,咱们来用Pandas的内置功能搞个更高效的方案。
首先先明确下需求:你要给每一行对应的当前时间之后10分钟内(t0 < index <= t0+10min)的数据,对列b做去重,原来用rolling_apply报错是因为它要求函数返回标量/一维数组,不能直接返回DataFrame。
方案1:获取每个窗口内的唯一b值列表
如果你的目标只是得到每个滚动窗口内的唯一b值(不需要保留对应行的其他数据),可以用滚动窗口结合apply来实现。这里要注意,因为你要的是向后窗口(当前时间之后10分钟),我们可以通过反转DataFrame把它转换成向前窗口处理:
import pandas as pd # 确保索引是datetime类型(如果还没转换的话) df.index = pd.to_datetime(df.index) # 定义函数:提取窗口内唯一的b值,返回一维数组 def get_unique_b(window): return window['b'].unique() # 反转DataFrame,将向后窗口转为向前窗口处理 reversed_df = df.iloc[::-1].copy() # 设置10分钟滚动窗口,closed='both'确保包含边界时间点 reversed_df['unique_b'] = reversed_df.rolling('10T', closed='both')['b'].apply(get_unique_b, raw=False) # 再反转回来,得到原DataFrame对应行的向后10分钟窗口唯一b值 df['unique_b'] = reversed_df['unique_b'].iloc[::-1]
这个方法的时间复杂度是O(n)级别的,比循环快得多,完全适配50万行的数据量。
方案2:保留窗口内去重后的完整行
如果你的目标是像循环那样得到每个窗口内去重后的完整行集合,要注意:50万行对应的窗口会产生大量重复数据,内存压力会很大。但我们可以用更高效的方式生成结果,比如用merge_asof替代循环切片:
import pandas as pd # 生成所有窗口的起始、结束时间及唯一ID windows_df = pd.DataFrame({ 'start': df.index, 'end': df.index + pd.Timedelta(minutes=10), 'window_id': range(len(df)) }) # 用merge_asof高效匹配每个数据行属于哪些窗口(适合有序时间索引) merged = pd.merge_asof( df.reset_index(), windows_df, left_on='index', right_on='start', direction='backward' ) # 过滤掉不在窗口时间范围内的行 merged = merged[merged['index'] <= merged['end']] # 按窗口ID分组,对b列去重 result = merged.groupby('window_id').apply(lambda x: x.drop_duplicates(subset='b')).reset_index(drop=True)
这个方法利用Pandas的高效匹配逻辑替代了循环里的逐行切片,性能会比原生循环提升一个量级。
为什么原来的rolling_apply报错
pd.rolling_apply(现在Pandas推荐用df.rolling().apply())要求传入的函数必须返回标量或者一维数组,而你用lambda x:x.drop_duplicates(subset='b')返回的是DataFrame,不符合要求,所以会报错。我们方案1里的函数返回的是一维数组(unique()的结果),就可以正常运行。
内容的提问来源于stack exchange,提问作者DrDamage

