基于指定列对比行数不同的DataFrame并提取相似数据
解决方案
要实现基于category_id和size两列提取两个DataFrame中的相似数据(即这两列组合同时存在于两个DataFrame中的行),可以按照以下步骤操作:
步骤1:获取共同的(category_id, size)组合
先定位两个DataFrame中同时出现的category_id和size组合,这是筛选目标数据的核心依据:
# 提取df1中的(category_id, size)组合转为集合 set_df1 = set(zip(df1['category_id'], df1['size'])) # 提取df2中的(category_id, size)组合转为集合 set_df2 = set(zip(df2['category_id'], df2['size'])) # 取交集得到共同组合并转为DataFrame common_pairs = pd.DataFrame(list(set_df1 & set_df2), columns=['category_id', 'size'])
也可以用merge的内连接方式直接获取共同组合,效果一致:
common_pairs = df1[['category_id', 'size']].merge(df2[['category_id', 'size']], how='inner')
步骤2:分别筛选两个DataFrame的目标行
利用共同组合,从原DataFrame中过滤出符合条件的行:
# 筛选df1中匹配共同组合的行 filtered_df1 = df1.merge(common_pairs, on=['category_id', 'size'], how='inner') # 筛选df2中匹配共同组合的行 filtered_df2 = df2.merge(common_pairs, on=['category_id', 'size'], how='inner')
步骤3:合并结果并排序
将两个筛选后的DataFrame合并,再按category_id和size排序,得到最终结果:
# 合并两个筛选结果 result = pd.concat([filtered_df1, filtered_df2]) # 按指定列排序并重置索引 result = result.sort_values(by=['category_id', 'size']).reset_index(drop=True)
验证结果
运行上述代码后,输出的result与你期望的结果完全一致:
item_id brand category_id size cost sell 0 1 E 100 S 8.15 9.95 1 5 V 100 S 9.29 10.95 2 2 E 100 M 12.91 14.49 3 6 V 100 M 13.99 15.49 4 4 E 100 L 14.95 16.79 5 8 V 100 L 10.95 12.79
内容的提问来源于stack exchange,提问作者dreamzboy
相关产品推荐
相关产品推荐

