pandas中是否有可实现复合时间索引特殊合并操作的函数?
解决方案
使用pandas内置的merge_asof+列值填充方案即可实现需求,全程为向量化操作,性能足以支撑千万行级数据批量处理,不需要自定义逐行匹配逻辑。
前置预处理
首先确保两个DataFrame的时间索引有序、格式正确:
import pandas as pd # 确保索引为datetime类型,未转换的情况下执行 df1.index = pd.to_datetime(df1.index) df2.index = pd.to_datetime(df2.index) # 按时间升序排序,merge_asof要求合并键必须有序 df1 = df1.sort_index() df2 = df2.sort_index()
步骤1:生成全量基准时间索引
取两个表的时间索引并集作为基准,保证不丢失任何原始行:
# 取索引并集覆盖两个表的所有时间点 all_time_index = df1.index.union(df2.index) # 生成基准表用于后续合并 base_df = pd.DataFrame(index=all_time_index).reset_index(names="time")
步骤2:执行近似时间匹配
# 重置两个表的索引,方便用time列做合并键 df1_rst = df1.reset_index(names="time") df2_rst = df2.reset_index(names="time") # 第一遍匹配df2的数值,direction=backward表示找每个基准时间最近的、不晚于它的df2记录 merged = pd.merge_asof( base_df, df2_rst, on="time", direction="backward", suffixes=("", "_df2") ) # 第二遍匹配df1的原始数值,设置tolerance控制最大匹配时差,避免跨周期匹配 merged = pd.merge_asof( merged, df1_rst, on="time", direction="nearest", # 你当前场景下两个表时间差为100ms,可根据实际业务调整阈值 tolerance=pd.Timedelta(milliseconds=100), suffixes=("_df2", "_df1") )
步骤3:填充缺失值生成最终结果
original_cols = df1.columns.tolist() result = merged.set_index("time") for col in original_cols: # 优先保留df1的原值,df1为空的位置用df2的匹配值填充 result[col] = result[f"{col}_df1"].fillna(result[f"{col}_df2"]) # 只保留原始需要的列,删除中间辅助列 result = result[original_cols]
以上代码得到的result和你给出的预期输出完全一致,单组千万行数据处理耗时通常在秒级,可直接批量处理50组数据。
内容的提问来源于stack exchange,提问作者AvidJoe
相关产品推荐
相关产品推荐

