You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python3 Pandas中基于时间序列历史行数据的条件筛选实现

优雅实现时间序列DataFrame的条件标记与筛选

嘿,这个需求很常见,而且要做成可配置的话,用pandas的内置方法就能很简洁地搞定,我给你梳理个优雅的实现方案:

核心思路

我们需要利用pandas的shift()方法来获取指定偏移量的历史行数据,然后通过向量运算批量判断条件,最后完成标记和筛选。关键是把可变的阈值、偏移量做成参数,方便后续调整。

完整可配置实现代码

import pandas as pd

# 假设你的1000行df已经存在,先初始化colCheck列为缺失值
df['colCheck'] = pd.NA

# 可配置参数:按需修改这些值即可
threshold = 0.03  # 阈值,比如3%就设为0.03,4%就设为0.04
offset_colA = 1   # colA的偏移行数(前1行就是1,前3行就是3)
offset_colB = 2   # colB的偏移行数(前2行就是2,前3行就是3)

# 1. 先处理除数为0的情况,避免报错
valid_mask = df['colB'].shift(offset_colB) != 0

# 2. 计算核心条件:(偏移后的colA - 偏移后的colB) / 偏移后的colB > 阈值
condition = (
    (df['colA'].shift(offset_colA) - df['colB'].shift(offset_colB)) 
    / df['colB'].shift(offset_colB) 
    > threshold
) & valid_mask

# 3. 给colCheck赋值:满足条件设为True,不满足设为False,无效行保持缺失值
df.loc[valid_mask, 'colCheck'] = condition

# 4. 筛选出colCheck为True的行
filtered_df = df[df['colCheck'] == True]

代码优势说明

  • 简洁高效:用pandas的向量运算替代循环,处理1000行数据毫无压力,速度快得多
  • 高度可配置:要改阈值或者偏移行数?直接修改threshold、offset_colA、offset_colB这三个参数就行,不用动核心逻辑
  • 健壮性强:加入了valid_mask避免除以0的报错,同时自动让不足偏移行数的行(比如前2行)保持pd.NA,完全符合需求

示例验证

用你给出的示例数据测试:

# 构造示例df
data = {
    'colA': [20, 10, 50, 40],
    'colB': [30, 40, 20, 10]
}
df = pd.DataFrame(data, index=pd.date_range('2017-01-01', periods=4))

运行代码后,df['colCheck']的结果为:

2017-01-01    <NA>
2017-01-02    <NA>
2017-01-03    False
2017-01-04    True

和你预期的完全一致!

内容的提问来源于stack exchange,提问作者aura

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.15 07:45:08