You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从DataFrame中删除所有存在重复记录的非唯一行

解决方案

你需要删除ORDER ID和ITEM CODE两个字段的组合出现重复的所有行,可通过以下两种方式实现:

方法1:使用drop_duplicates方法

显式指定判断重复的列,设置keep=False删除所有重复组合对应的行:

import pandas as pd

# 示例数据构造
df = pd.DataFrame({
    'ORDER ID': ['123', '123', '123', '456', '456', '456', '789', '000'],
    'ITEM CODE': ['XXX', 'YYY', 'YYY', 'XXX', 'XXX', 'XXX', 'XXX', 'YYY']
})

# 去重操作
result = df.drop_duplicates(subset=['ORDER ID', 'ITEM CODE'], keep=False)

之前调用方法未得到预期结果,大概率是没有显式指定subset参数,当DataFrame存在其他未展示字段时,默认会基于全表所有字段判断重复,导致结果不符合预期。

方法2:使用groupby过滤

通过分组统计每个组合的出现次数,仅保留出现次数为1的组合:

result = df.groupby(['ORDER ID', 'ITEM CODE'], group_keys=False).filter(lambda x: len(x) == 1)

两种方法输出的结果均和你的预期一致:

ORDER ID ITEM CODE
0      123       XXX
6      789       XXX
7      000       YYY

内容的提问来源于stack exchange,提问作者datanerd

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 03:45:05