如何判断Pandas Series元素在另一Series中恰好匹配1次且不重复使用
Pandas 实现无重复一对一合同编号匹配方案
你要实现的是两个编号列的不重复一对一匹配,核心逻辑是给同编号的重复条目加匹配序号,保证每个条目只能匹配一次,具体实现如下:
之前三个方案的错误原因
- 第一个
str.contains写法:str(audit0)会把整个audit0DataFrame 转成包含索引、列名、所有值的长字符串,用这个长字符串匹配每行的PolicyNumber,自然几乎匹配不到,结果为空。 - 第二个循环写法:语法本身不成立,遍历单列Series无法同时拿到
i和row两个参数,且判断条件是单个值和整个Series做比较,返回的布尔数组无法直接用于if判断。 - 第三个merge写法:merge返回的是完整DataFrame,长度和原表
coll的长度不一致,直接赋值给单个列会触发维度不匹配报错。
可行实现代码
核心思路是给两个编号列的同编号重复项,按出现顺序加匹配序号,用「编号+序号」作为唯一匹配键,保证同编号的第N次出现只会匹配对方的第N次出现,完全满足「匹配过的条目不可重复使用」的要求。
import pandas as pd import numpy as np # 步骤1:给Policy #(列表A)的非空条目加匹配序号 df_a = coll[coll["Policy #"].notna()].copy() df_a["match_seq"] = df_a.groupby("Policy #").cumcount() # 步骤2:给PolicyNumber(列表B)的非空条目加匹配序号 df_b = coll[coll["PolicyNumber"].notna()].copy() df_b["match_seq"] = df_b.groupby("PolicyNumber").cumcount() # 步骤3:按「编号+序号」合并,标记匹配结果 match_result = df_a.merge( df_b[["PolicyNumber", "match_seq"]], left_on=["Policy #", "match_seq"], right_on=["PolicyNumber", "match_seq"], how="left" ) match_result["Payment?"] = np.where(match_result["PolicyNumber"].notna(), "yes", "no") # 步骤4:把匹配结果合并回原表 coll = coll.merge( match_result[["Policy #", "match_seq", "Payment?"]], on=["Policy #", "match_seq"], how="left" ) # 可选:删掉不需要的匹配序号列 coll = coll.drop("match_seq", axis=1)
内容的提问来源于stack exchange,提问作者quaaalud
相关产品推荐
相关产品推荐

