You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

多变量DataFrame的Timestamp插值:长转宽与全时间戳值填充需求问询

实现思路与代码示例

1. Spark DataFrame转Pandas

因为数据体量小,直接用Spark的toPandas()方法转换即可:

import pandas as pd

# 假设你的Spark DataFrame名为spark_df
pandas_df = spark_df.toPandas()

2. 转宽格式(自动生成变量列)

用Pandas的pivot()方法直接转换,无需手动遍历变量列表,会自动把variable_name的每个取值转为单独列:

# 先确保timestamp是datetime类型,避免后续时间序列处理出错
pandas_df['timestamp'] = pd.to_datetime(pandas_df['timestamp'])

# 执行pivot:timestamp作为索引,variable_name转列,value填充对应值
wide_df = pandas_df.pivot(index='timestamp', columns='variable_name', values='value')

3. 生成完整时间序列并插值

先根据数据的时间频率生成完整的时间索引,再重新对齐数据并完成插值填充:

# 生成完整时间索引,这里假设时间间隔为1小时,可根据实际需求修改(比如'1T'代表分钟、'D'代表天)
full_time_index = pd.date_range(start=wide_df.index.min(), end=wide_df.index.max(), freq='H')

# 重新索引补全缺失时间戳,用线性插值填充空值(可替换为'time'/'nearest'等方法)
complete_wide_df = wide_df.reindex(full_time_index).interpolate(method='linear')

补充说明

  • 若时间频率不规整,可改用pd.Index(pandas_df['timestamp'].unique()).sort_values()生成完整索引,再执行重新索引和插值。
  • 插值方法可根据业务需求调整,比如method='time'会基于时间间隔加权插值,更适合时序数据场景。

内容的提问来源于stack exchange,提问作者Cedric H.

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.02 23:20:43