使用Python去除Excel重复记录失败,求原因及解决方法
问题原因及解决方法
- 核心原因:
drop_duplicates默认不会修改原始DataFrame,你调用方法后没把去重后的结果重新赋值给df,原数据根本没变化,导出的文件自然还有重复项。 - 两种解决办法:
- 将去重结果赋值回
df:df = pd.read_excel("file_path") df = df.drop_duplicates(subset=["Name","Discription"], keep='first') df.to_excel("New.xlsx",index=False) - 使用
inplace=True参数直接修改原DataFrame:df = pd.read_excel("file_path") df.drop_duplicates(subset=["Name","Discription"], keep='first', inplace=True) df.to_excel("New.xlsx",index=False)
- 将去重结果赋值回
- 额外排查点:检查Excel里的列名是否和代码里的完全一致——你写的是
Discription,是不是拼写错了?正确的单词是Description,如果列名实际是后者,subset指定错误也会导致去重失效。
内容的提问来源于stack exchange,提问作者Krishan Kottahachchi
相关产品推荐
相关产品推荐

