如何去除Pandas DataFrame中animals列每行的重复值?
嘿,我懂你卡在哪了!你要的是去除DataFrame里animals列每行字符串内部的重复值,但drop_duplicates、unique这些方法都是用来处理整行或者列级别的重复,自然对行内的重复内容无效啦~
下面给你两种可行的解决方案,按需选择:
方案一:自定义函数+apply处理(适合小数据集)
先确认你的输入数据:
import pandas as pd df = pd.DataFrame ({ 'animals':[ 'pink pig, pink pig, pink pig', 'brown cow, brown cow', 'pink pig, black cow', 'brown horse, pink pig, brown cow, black cow, brown cow' ] })
我们可以写一个小函数专门处理每行的字符串:
- 把字符串按
,分割成单个动物的列表 - 去重同时保留元素第一次出现的顺序(用
dict.fromkeys比set更能保证原始顺序) - 重新拼接成目标格式的字符串
代码实现:
def clean_animal_string(s): # 分割成单个动物的列表 animal_list = s.split(', ') # 去重并保留原始出现顺序 unique_animals = list(dict.fromkeys(animal_list)) # 重新拼接成字符串 return ', '.join(unique_animals) # 将函数应用到animals列 df['animals'] = df['animals'].apply(clean_animal_string)
运行后就能得到你想要的结果:
animals 0 pink pig 1 brown cow 2 pink pig, black cow 3 brown horse, pink pig, brown cow, black cow
方案二:矢量化操作(适合大数据集)
如果你的数据集规模较大,apply的效率可能不够,这时候可以用pandas的矢量化方法处理,速度会快很多:
df['animals'] = df['animals'].str.split(', ') \ .explode() # 把每行的动物列表拆成单独行 .groupby(level=0) \ .unique() # 按原行号分组去重(pandas 1.3+版本会保留元素出现顺序) .str.join(', ') # 重新拼接成字符串
这个方法利用pandas内置的矢量化操作,比自定义函数的apply更高效,输出结果和方案一完全一致。
为啥之前的方法不管用?
给你简单理清楚逻辑:
drop_duplicates():作用是删除整个重复的行,不是处理行内的重复元素unique():返回的是整个列里唯一的整行值,不会拆分字符串做内部处理nunique():只是统计列里有多少个唯一的整行值,根本不会修改数据
内容的提问来源于stack exchange,提问作者BobcatBlitz
相关产品推荐
相关产品推荐

