pandas如何从现有DataFrame提取列唯一值及对应列值生成新DataFrame
pandas按customer_code去重保留对应market_code的实现
直接用drop_duplicates方法即可完成需求,适配示例场景(同一个customer_code对应的market_code值完全统一)的代码如下:
# 提取目标列后按customer_code去重,保留每个客户的第一条匹配记录 new_df = raw[['customer_code', 'market_code']].drop_duplicates( subset='customer_code', keep='first' ).reset_index(drop=True)
参数说明
subset='customer_code':指定去重判定维度为客户编码列,只要该列值重复就判定为重复行keep='first':重复项保留首次出现的记录,如果你需要保留最后一次出现的记录可修改为keep='last'reset_index(drop=True):重置新表的连续索引,丢弃原表的旧索引,避免索引断层
异常数据校验(可选)
如果担心源数据存在同一个customer_code对应多个不同market_code的脏数据,可以先运行以下代码排查异常,确认无异常后再执行去重逻辑:
# 筛选出对应多个不同market_code的客户编码 abnormal_customer = raw.groupby('customer_code')['market_code'].nunique().query("market_code > 1") print("存在多市场编码匹配的客户:\n", abnormal_customer)
内容的提问来源于stack exchange,提问作者user18587858
相关产品推荐
相关产品推荐

