寻求字符串模式匹配算法助力DataFrame合并的技术方案及文献
多列生成匹配ID的DataFrame合并问题及技术咨询
我需要将两个DataFrame通过多列拼接生成的ID进行合并,示例代码如下:
df.Id = df.A + df.B + df.C df2.Id= df2.A2 + df2.D2 + df2.E2 +df2.F2
但直接的列拼接无法生成匹配的ID,且由于两侧列数不同、ID存在可变部分,无法直接使用多列作为合并键。目前只能通过手动排查设置例外规则,例如:
df2.loc[df2.A2.str.contains('-'),'Id'] = df2.D2 + df2.E2 +df2.F2
技术疑问及文献参考需求
- 是否存在可加速发现或可视化此类子群体的方法(如聚类算法)?
- 是否有算法可辅助识别此类子群体的模式差异(如
df2.A2包含"-")及对应的修复方式(如省略A2以生成正确匹配模式)?
内容的提问来源于stack exchange,提问作者euh
相关产品推荐
相关产品推荐

