You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

pandas如何从现有DataFrame提取列唯一值及对应列值生成新DataFrame

pandas按customer_code去重保留对应market_code的实现

直接用drop_duplicates方法即可完成需求,适配示例场景(同一个customer_code对应的market_code值完全统一)的代码如下:

# 提取目标列后按customer_code去重,保留每个客户的第一条匹配记录
new_df = raw[['customer_code', 'market_code']].drop_duplicates(
    subset='customer_code',
    keep='first'
).reset_index(drop=True)

参数说明

  • subset='customer_code':指定去重判定维度为客户编码列,只要该列值重复就判定为重复行
  • keep='first':重复项保留首次出现的记录,如果你需要保留最后一次出现的记录可修改为keep='last'
  • reset_index(drop=True):重置新表的连续索引,丢弃原表的旧索引,避免索引断层

异常数据校验(可选)

如果担心源数据存在同一个customer_code对应多个不同market_code的脏数据,可以先运行以下代码排查异常,确认无异常后再执行去重逻辑:

# 筛选出对应多个不同market_code的客户编码
abnormal_customer = raw.groupby('customer_code')['market_code'].nunique().query("market_code > 1")
print("存在多市场编码匹配的客户:\n", abnormal_customer)

内容的提问来源于stack exchange,提问作者user18587858

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.29 06:27:14