You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在多个pandas dataframe中按指定列查找相同序列及其对应行

实现思路
  • 首先提取所有数据表指定列的有序序列,可根据需求选择是否忽略大小写匹配
  • 生成每个序列所有长度≥2的连续子序列,通过集合求交集得到所有表共有的连续有序序列
  • 遍历所有公共序列,回各个原表匹配对应位置的完整行,汇总输出结果
    该方案可以支持100+张表的批量处理,计算量随表数量和单表长度线性增长,常规数据量下性能足够。
完整代码实现
import pandas as pd
from collections import defaultdict

def get_all_continuous_subseqs(seq, min_len=2):
    """提取序列的所有连续子序列(长度≥min_len)"""
    subseqs = set()
    n = len(seq)
    for i in range(n):
        for j in range(i + min_len - 1, n):
            subseqs.add(tuple(seq[i:j+1]))
    return subseqs

def find_common_ordered_rows(df_list, target_col, min_seq_len=2, ignore_case=False):
    """
    多表查找相同先后顺序的序列及对应行
    参数:
        df_list: 待处理的pandas DataFrame列表
        target_col: 用于匹配顺序的指定列名
        min_seq_len: 匹配序列的最小长度,默认2
        ignore_case: 字符串匹配是否忽略大小写,默认False
    返回:
        字典结构,key为公共序列,value为各表对应的匹配行列表
    """
    # 步骤1:预处理所有表的目标列序列
    seq_list = []
    for df in df_list:
        col_data = df[target_col].astype(str)
        if ignore_case:
            col_data = col_data.str.lower()
        seq_list.append(col_data.tolist())
    
    # 步骤2:求所有表的公共连续子序列
    common_subseqs = get_all_continuous_subseqs(seq_list[0], min_seq_len)
    for seq in seq_list[1:]:
        current_subseqs = get_all_continuous_subseqs(seq, min_seq_len)
        common_subseqs &= current_subseqs
        if not common_subseqs:
            break  # 无公共序列提前终止
    
    # 步骤3:匹配每个公共序列对应的原表行
    result = defaultdict(lambda: defaultdict(list))
    for subseq in common_subseqs:
        subseq_len = len(subseq)
        for df_idx, seq in enumerate(seq_list):
            n = len(seq)
            for i in range(n - subseq_len + 1):
                if tuple(seq[i:i+subseq_len]) == subseq:
                    # 提取原表对应行
                    match_rows = df_list[df_idx].iloc[i:i+subseq_len].copy()
                    result[subseq][f"表{df_idx+1}"].append(match_rows)
    return result

# ------------------- 示例运行 -------------------
if __name__ == "__main__":
    # 构造示例表A
    df_a = pd.DataFrame({
        "column1": [1,2,3,4],
        "column2": ["a","c","d","b"],
        "column3": ["p1","p3","P4","p2"]
    })
    # 构造示例表B
    df_b = pd.DataFrame({
        "column1": [1,2,3,4,5],
        "column2": ["x","x","y","z","w"],
        "column3": ["p20","p20","p3","P4","p7"]
    })
    
    # 执行匹配,基于column3列
    res = find_common_ordered_rows(df_list=[df_a, df_b], target_col="column3", min_seq_len=2)
    
    # 打印结果
    for common_seq, table_matches in res.items():
        print(f"匹配到公共序列:{common_seq}")
        for table_name, rows in table_matches.items():
            print(f"{table_name}匹配行:")
            for row_df in rows:
                print(row_df)
        print("-"*50)
输出说明
  • 示例运行后会输出匹配到的公共序列('p3', 'P4'),以及表A、表B对应的两行匹配数据,和需求预期一致
  • 如果有≥3张表,只需将所有DataFrame放入df_list参数即可自动批量处理
  • 如果需要调整匹配的序列最小长度,修改min_seq_len参数即可
  • 开启ignore_case=True可支持大小写不敏感的匹配,比如可以匹配到p4和P4为相同值
  • 若单表数据量超过1万行,可将公共子序列查找逻辑替换为后缀自动机实现,进一步提升计算效率

内容的提问来源于stack exchange,提问作者Kevin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.03 00:36:04