You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas中为时间序列DataFrame创建多列滞后特征?

生成时间序列滞后特征的简洁实现方案

嘿,这个需求其实用Pandas的shift()配合简单的列表推导或者循环就能完美解决,我来给你分享两种高效的实现方式:

方法一:简洁的列表推导式(推荐)

这种方式代码更紧凑,而且避免了循环中多次拼接数据的性能损耗,适合处理200列这种规模的数据集:

import pandas as pd

# 假设你的原始时间序列DataFrame名为df
lag_steps = [1, 2, 3, 4]  # 你需要的滞后步长

# 一次性生成所有滞后列,同时完成重命名
lag_features = [
    df[col].shift(lag).rename(f"{col} (t-{lag})")
    for col in df.columns
    for lag in lag_steps
]

# 合并原始特征和所有滞后特征,得到最终数据集
final_df = pd.concat([df] + lag_features, axis=1)

方法二:直观的循环实现

如果你更喜欢分步清晰的逻辑,用双重循环也完全可行,可读性更强:

import pandas as pd

lag_steps = [1, 2, 3, 4]
final_df = df.copy()  # 先复制原始数据保留原特征

for feature in df.columns:
    for lag in lag_steps:
        # 生成滞后列并按要求命名
        shifted_col = df[feature].shift(lag)
        shifted_col.name = f"{feature} (t-{lag})"
        # 将新列添加到最终DataFrame中
        final_df = pd.concat([final_df, shifted_col], axis=1)

关键注意事项

  • 缺失值处理:生成滞后特征后,前lag行会出现NaN值,你可以根据业务需求用final_df.fillna(method='ffill')(前向填充)、final_df.fillna(df.mean())(均值填充)等方式处理。
  • 索引顺序:确保你的DataFrame的行是按时间顺序排列的,shift()是基于行的顺序进行偏移的,乱序的话会导致滞后特征完全错误。
  • 是否保留原特征:如果不需要原始的t时刻特征,只需要滞后特征,把代码里的[df]换成空列表即可,最终会得到200*4=800列的纯滞后特征数据集。

内容的提问来源于stack exchange,提问作者swifty

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 08:23:28