You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于区间重叠合并DataFrame 选择最短匹配区间的Info列

解决Pandas大DataFrame区间重叠匹配并筛选最短区间的问题

针对你遇到的大DataFrame区间重叠匹配需求,我这里提供一个高效的向量化解决方案,完全避开迭代类方法,符合你期望的类似merge的操作逻辑:

核心思路

  1. 先给B计算每个区间的长度,方便后续筛选最短重叠区间;
  2. 通过交叉连接+条件过滤,找出A和B所有区间重叠的配对(向量化操作,远快于迭代);
  3. 按A的每一行分组,在每组重叠的B行中筛选出区间最短的那个,提取对应的Info值;
  4. 将筛选结果合并回原A,得到最终带Info列的DataFrame。

完整代码实现

import pandas as pd
import numpy as np

# 初始化示例DataFrame
A = pd.DataFrame({'Start': [10, 11, 20, 62, 198], 'End': [11, 11, 35, 70, 200]})
B = pd.DataFrame({'Start': [8, 5, 8, 60], 'End': [10, 90, 13, 75], 'Info': ['some_info0','some_info1','some_info2','some_info3']})

# 步骤1:预处理B,计算区间长度,重置索引用于后续分组
B = B.reset_index().rename(columns={'index': 'B_idx'})
B['length'] = B['End'] - B['Start']

# 步骤2:预处理A,重置索引用于后续分组
A = A.reset_index().rename(columns={'index': 'A_idx'})

# 步骤3:交叉连接并筛选出所有区间重叠的配对
# 区间重叠的条件:A的Start <= B的End 且 A的End >= B的Start
merged = A.merge(B, how='cross').query('Start_x <= End_y and End_x >= Start_y')

# 步骤4:按A的索引分组,筛选每组中B区间最短的行
min_length_rows = merged.loc[merged.groupby('A_idx')['length'].idxmin()]

# 步骤5:合并回原A,得到最终结果
result = A.drop(columns=['A_idx']).merge(
    min_length_rows[['A_idx', 'Info']], 
    on='A_idx', 
    how='left'
).drop(columns=['A_idx'])

print(result)

输出结果验证

运行上述代码后,输出将完全符合你的预期:

Start  End        Info
0     10   11  some_info0
1     11   11  some_info2
2     20   35  some_info1
3     62   70  some_info3
4    198  200        NaN

超大DataFrame的优化说明

如果你的DataFrame规模大到交叉连接占用内存过多,可以改用IntervalIndex的方式来减少中间数据量,代码如下:

import pandas as pd
import numpy as np

A = pd.DataFrame({'Start': [10, 11, 20, 62, 198], 'End': [11, 11, 35, 70, 200]})
B = pd.DataFrame({'Start': [8, 5, 8, 60], 'End': [10, 90, 13, 75], 'Info': ['some_info0','some_info1','some_info2','some_info3']})

# 构建B的IntervalIndex并计算区间长度
b_intervals = pd.IntervalIndex.from_arrays(B['Start'], B['End'], closed='both')
B['length'] = B['End'] - B['Start']

# 定义函数,为A的每个区间找到最优Info
def get_best_info(row):
    a_interval = pd.Interval(row['Start'], row['End'], closed='both')
    # 筛选所有重叠的B行
    mask = b_intervals.overlaps(a_interval)
    if not mask.any():
        return np.nan
    # 返回最短区间的Info
    return B.loc[mask].nsmallest(1, 'length')['Info'].iloc[0]

# 向量化应用(比iterrows高效,适合超大DataFrame)
A['Info'] = A.apply(get_best_info, axis=1)

print(A)

这个方法通过逐行处理A,但利用IntervalIndex的向量化重叠判断,比纯迭代快很多,内存占用也更低。

内容的提问来源于stack exchange,提问作者Pau RS

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.15 03:28:49