如何对带MultiIndex的Pandas DataFrame按时间戳截断数据?
解决MultiIndex下按时间索引截断DataFrame的问题
问题原因
直接调用df.truncate()报错是因为你的DataFrame使用了MultiIndex(多层索引),truncate默认仅处理单索引场景,必须明确指定要操作的索引级别(这里是timestamp)。
解决方案
方法1:给truncate指定level参数
在truncate中通过level参数指定要截断的索引层级,可使用层级名称或位置(timestamp是第二个索引,位置为1):
# 按索引名称指定 df_truncated = df.truncate(after='2020-01-04 00:00:00', level='timestamp') # 或按索引位置指定(第二个索引位置为1) df_truncated = df.truncate(after='2020-01-04 00:00:00', level=1)
方法2:用布尔索引筛选(更直观)
提取timestamp层级的索引值,通过布尔判断筛选符合时间范围的行,这种方式上手简单,不易出错:
import pandas as pd target_time = pd.to_datetime('2020-01-04 00:00:00') # 获取timestamp索引层的所有值,筛选小于等于目标时间的行 mask = df.index.get_level_values('timestamp') <= target_time df_truncated = df[mask]
方法3:分组阶段提前过滤(可选优化)
如果数据是通过groupby().resample()生成的,也可以在分组重采样阶段直接过滤时间范围,避免后续截断操作:
import pandas as pd target_time = pd.to_datetime('2020-01-04 00:00:00') df_truncated = ( df.groupby('pair') .resample('1H', on='timestamp') # 示例按小时重采样,可根据需求调整频率 .agg({'open': 'first', 'high': 'max', 'low': 'min', 'close': 'last'}) .query('timestamp <= @target_time') # 直接在分组后过滤时间 )
内容的提问来源于stack exchange,提问作者Mikko Ohtamaa
相关产品推荐
相关产品推荐

