You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在整个pandas DataFrame中查找重复值(而非重复行)

解决方法

核心思路是先将宽表转为长格式保留原行索引,再筛选出所有存在重复的值对应的全量记录即可,完整实现代码如下:

import pandas as pd

# 构造示例DataFrame
df = pd.DataFrame(data={'one': list('abcd'),
                        'two': list('efgh'),
                        'three': list('ajha')})

# 宽表转长表,保留原行索引作为id字段
long_df = df.melt(ignore_index=False).reset_index(names='id')[['id', 'value']]
# 筛选所有出现过重复的value对应的全部记录,按value倒序排序适配预期输出
res = long_df[long_df['value'].duplicated(keep=False)].sort_values('value', ascending=False).reset_index(drop=True)

print(res)

运行后输出结果和预期一致:

id value
0   2     h
1   3     h
2   0     a
3   0     a
4   3     a

代码说明

  • melt(ignore_index=False):将多列的宽表转为两列的长表,同时保留原DataFrame的行索引不丢失
  • duplicated(keep=False):对value列做重复值标记,所有出现次数≥2的value对应的行都会被标记为True,以此作为过滤条件就能拿到所有重复值对应的全部行记录

内容的提问来源于stack exchange,提问作者user2962397

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.04 04:00:01