使用Python Pandas实现CSV数据按日期去重保留首次出现记录的方法
实现代码
import pandas as pd # 读取源文件 data = pd.read_csv('data.csv') # 按Date列去重,保留每个日期首次出现的行 deduplicated_df = data.drop_duplicates(subset='Date', keep='first') # 按日期降序排序,匹配预期输出的时间倒序格式 deduplicated_df = deduplicated_df.sort_values(by='Date', ascending=False) # 打印输出结果 print(deduplicated_df.to_csv(index=False)) # 如果需要保存为新csv文件,使用下面的语句 # deduplicated_df.to_csv('result.csv', index=False)
关键逻辑说明
drop_duplicates方法的subset='Date'参数指定仅按Date列判断重复行keep='first'参数指定重复行仅保留首次出现的记录,完全匹配需求规则- 新增的
sort_values步骤是为了对齐你给出的预期输出的时间倒序排列,如果不需要调整输出顺序可以省略这行代码
内容的提问来源于stack exchange,提问作者georgehere
相关产品推荐
相关产品推荐

