You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于指定列对比行数不同的DataFrame并提取相似数据

解决方案

要实现基于category_id和size两列提取两个DataFrame中的相似数据(即这两列组合同时存在于两个DataFrame中的行),可以按照以下步骤操作:

步骤1:获取共同的(category_id, size)组合

先定位两个DataFrame中同时出现的category_id和size组合,这是筛选目标数据的核心依据:

# 提取df1中的(category_id, size)组合转为集合
set_df1 = set(zip(df1['category_id'], df1['size']))
# 提取df2中的(category_id, size)组合转为集合
set_df2 = set(zip(df2['category_id'], df2['size']))
# 取交集得到共同组合并转为DataFrame
common_pairs = pd.DataFrame(list(set_df1 & set_df2), columns=['category_id', 'size'])

也可以用merge的内连接方式直接获取共同组合,效果一致:

common_pairs = df1[['category_id', 'size']].merge(df2[['category_id', 'size']], how='inner')

步骤2:分别筛选两个DataFrame的目标行

利用共同组合,从原DataFrame中过滤出符合条件的行:

# 筛选df1中匹配共同组合的行
filtered_df1 = df1.merge(common_pairs, on=['category_id', 'size'], how='inner')
# 筛选df2中匹配共同组合的行
filtered_df2 = df2.merge(common_pairs, on=['category_id', 'size'], how='inner')

步骤3:合并结果并排序

将两个筛选后的DataFrame合并,再按category_id和size排序,得到最终结果:

# 合并两个筛选结果
result = pd.concat([filtered_df1, filtered_df2])
# 按指定列排序并重置索引
result = result.sort_values(by=['category_id', 'size']).reset_index(drop=True)

验证结果

运行上述代码后,输出的result与你期望的结果完全一致:

item_id brand  category_id size   cost   sell
0        1     E          100    S   8.15   9.95
1        5     V          100    S   9.29  10.95
2        2     E          100    M  12.91  14.49
3        6     V          100    M  13.99  15.49
4        4     E          100    L  14.95  16.79
5        8     V          100    L  10.95  12.79

内容的提问来源于stack exchange,提问作者dreamzboy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.08 05:22:50