You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何判断Pandas Series元素在另一Series中恰好匹配1次且不重复使用

Pandas 实现无重复一对一合同编号匹配方案

你要实现的是两个编号列的不重复一对一匹配,核心逻辑是给同编号的重复条目加匹配序号,保证每个条目只能匹配一次,具体实现如下:

之前三个方案的错误原因

  • 第一个str.contains写法:str(audit0)会把整个audit0 DataFrame 转成包含索引、列名、所有值的长字符串,用这个长字符串匹配每行的PolicyNumber,自然几乎匹配不到,结果为空。
  • 第二个循环写法:语法本身不成立,遍历单列Series无法同时拿到i和row两个参数,且判断条件是单个值和整个Series做比较,返回的布尔数组无法直接用于if判断。
  • 第三个merge写法:merge返回的是完整DataFrame,长度和原表coll的长度不一致,直接赋值给单个列会触发维度不匹配报错。

可行实现代码

核心思路是给两个编号列的同编号重复项,按出现顺序加匹配序号,用「编号+序号」作为唯一匹配键,保证同编号的第N次出现只会匹配对方的第N次出现,完全满足「匹配过的条目不可重复使用」的要求。

import pandas as pd
import numpy as np

# 步骤1:给Policy #(列表A)的非空条目加匹配序号
df_a = coll[coll["Policy #"].notna()].copy()
df_a["match_seq"] = df_a.groupby("Policy #").cumcount()

# 步骤2:给PolicyNumber(列表B)的非空条目加匹配序号
df_b = coll[coll["PolicyNumber"].notna()].copy()
df_b["match_seq"] = df_b.groupby("PolicyNumber").cumcount()

# 步骤3:按「编号+序号」合并,标记匹配结果
match_result = df_a.merge(
    df_b[["PolicyNumber", "match_seq"]],
    left_on=["Policy #", "match_seq"],
    right_on=["PolicyNumber", "match_seq"],
    how="left"
)
match_result["Payment?"] = np.where(match_result["PolicyNumber"].notna(), "yes", "no")

# 步骤4:把匹配结果合并回原表
coll = coll.merge(
    match_result[["Policy #", "match_seq", "Payment?"]],
    on=["Policy #", "match_seq"],
    how="left"
)
# 可选:删掉不需要的匹配序号列
coll = coll.drop("match_seq", axis=1)

内容的提问来源于stack exchange,提问作者quaaalud

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.04 06:27:03