如何在整个pandas DataFrame中查找重复值(而非重复行)
解决方法
核心思路是先将宽表转为长格式保留原行索引,再筛选出所有存在重复的值对应的全量记录即可,完整实现代码如下:
import pandas as pd # 构造示例DataFrame df = pd.DataFrame(data={'one': list('abcd'), 'two': list('efgh'), 'three': list('ajha')}) # 宽表转长表,保留原行索引作为id字段 long_df = df.melt(ignore_index=False).reset_index(names='id')[['id', 'value']] # 筛选所有出现过重复的value对应的全部记录,按value倒序排序适配预期输出 res = long_df[long_df['value'].duplicated(keep=False)].sort_values('value', ascending=False).reset_index(drop=True) print(res)
运行后输出结果和预期一致:
id value 0 2 h 1 3 h 2 0 a 3 0 a 4 3 a
代码说明
melt(ignore_index=False):将多列的宽表转为两列的长表,同时保留原DataFrame的行索引不丢失duplicated(keep=False):对value列做重复值标记,所有出现次数≥2的value对应的行都会被标记为True,以此作为过滤条件就能拿到所有重复值对应的全部行记录
内容的提问来源于stack exchange,提问作者user2962397
相关产品推荐
相关产品推荐

