You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何去除Pandas DataFrame中animals列每行的重复值?

嘿,我懂你卡在哪了!你要的是去除DataFrame里animals列每行字符串内部的重复值,但drop_duplicates、unique这些方法都是用来处理整行或者列级别的重复,自然对行内的重复内容无效啦~

下面给你两种可行的解决方案,按需选择:

方案一:自定义函数+apply处理(适合小数据集)

先确认你的输入数据:

import pandas as pd

df = pd.DataFrame ({
    'animals':[
        'pink pig, pink pig, pink pig',
        'brown cow, brown cow',
        'pink pig, black cow',
        'brown horse, pink pig, brown cow, black cow, brown cow'
    ]
})

我们可以写一个小函数专门处理每行的字符串:

  1. 把字符串按, 分割成单个动物的列表
  2. 去重同时保留元素第一次出现的顺序(用dict.fromkeys比set更能保证原始顺序)
  3. 重新拼接成目标格式的字符串

代码实现:

def clean_animal_string(s):
    # 分割成单个动物的列表
    animal_list = s.split(', ')
    # 去重并保留原始出现顺序
    unique_animals = list(dict.fromkeys(animal_list))
    # 重新拼接成字符串
    return ', '.join(unique_animals)

# 将函数应用到animals列
df['animals'] = df['animals'].apply(clean_animal_string)

运行后就能得到你想要的结果:

animals
0                     pink pig
1                     brown cow
2            pink pig, black cow
3  brown horse, pink pig, brown cow, black cow
方案二:矢量化操作(适合大数据集)

如果你的数据集规模较大,apply的效率可能不够,这时候可以用pandas的矢量化方法处理,速度会快很多:

df['animals'] = df['animals'].str.split(', ') \
    .explode()  # 把每行的动物列表拆成单独行
    .groupby(level=0) \
    .unique()  # 按原行号分组去重(pandas 1.3+版本会保留元素出现顺序)
    .str.join(', ')  # 重新拼接成字符串

这个方法利用pandas内置的矢量化操作,比自定义函数的apply更高效,输出结果和方案一完全一致。

为啥之前的方法不管用?

给你简单理清楚逻辑:

  • drop_duplicates():作用是删除整个重复的行,不是处理行内的重复元素
  • unique():返回的是整个列里唯一的整行值,不会拆分字符串做内部处理
  • nunique():只是统计列里有多少个唯一的整行值,根本不会修改数据

内容的提问来源于stack exchange,提问作者BobcatBlitz

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.14 06:24:05