使用Python pandas实现Excel数据忽略大小写的重复值删除
实现忽略大小写去重的调整方案
你可以通过先统一列内容大小写判断重复项,再筛选保留原始格式内容的方式实现需求,调整后的代码如下:
import pandas as pd data = pd.read_excel('data.xlsx', header=None) # ~表示取反,保留所有非重复的行,默认保留第一次出现的内容 data = data[~data[0].str.lower().duplicated()] data.to_excel('sts.xlsx', index=False, header=False)
代码说明
- 核心逻辑:先通过
str.lower()把目标列的所有内容转为小写,用duplicated()判断重复项,再取反筛选出非重复的行,既实现了忽略大小写的去重效果,也保留了首次出现内容的原始大小写格式。 - 若需要保留最后一次出现的原始格式内容,可修改为
data = data[~data[0].str.lower().duplicated(keep='last')]。 - 若需要对多列执行忽略大小写去重,可使用如下写法:
# 多列忽略大小写去重 data = data[~data.apply(lambda x: x.str.lower()).duplicated()]
内容的提问来源于stack exchange,提问作者EL-AJI Oussama
相关产品推荐
相关产品推荐

