You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python Pandas中获取重复值对应索引的问题

正确获取DataFrame指定列重复值对应的索引

核心问题

你之前的错误在于混淆了列值重复和索引值重复:

  • df.index.duplicated(keep=False)是检测索引本身是否重复,和你要找的「某列值重复的行」完全无关
  • 循环获取索引出错大概率是遍历逻辑有误,且循环完全没必要——pandas的向量式操作更高效、简洁

正确实现步骤

  1. 针对目标列生成重复值的布尔掩码

    # 替换成你的目标列名,比如'target_column'
    mask = df['target_column'].duplicated(keep=False)
    

    这个mask是布尔Series,True对应目标列值重复的行

  2. 用掩码筛选DataFrame并提取索引

    duplicate_indices = df[mask].index.tolist()
    

    直接得到所有目标列值重复的行的索引列表

示例验证

import pandas as pd

# 构造测试数据(模拟你的目标索引场景)
data = {'col': [10, 20, 20, 20, 30, 30]}
df = pd.DataFrame(data, index=[5060, 5063, 5064, 5065, 5312, 5313])

# 获取col列重复值的索引
mask = df['col'].duplicated(keep=False)
duplicate_indices = df[mask].index.tolist()
print(duplicate_indices)  # 输出: [5063, 5064, 5065, 5312, 5313]

补充说明

  • duplicated(keep=False)会标记所有重复出现的行(包括第一次出现的);如果只想标记除首次外的重复行,可改成keep='first',反之用keep='last'
  • 永远优先用pandas的掩码筛选替代循环遍历,无论是代码可读性还是执行效率都更优

内容的提问来源于stack exchange,提问作者martinmistere

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.25 13:27:06