如何合并Pandas DataFrame中重复国家行并累加新冠病例数据?
合并Pandas DataFrame中重复国家行并累加确诊数据
1. 导入依赖并读取数据
先确保已安装Pandas,再读取你的数据集:
import pandas as pd # 替换为你的数据集文件路径 df = pd.read_csv('your_covid_data.csv')
2. 确认重复的国家记录
先排查哪些国家存在重复行,方便后续验证:
# 替换'Country'为你数据集中的国家列名称 duplicate_countries = df[df.duplicated('Country', keep=False)]['Country'].unique() print("存在重复的国家:", duplicate_countries)
3. 合并重复行并累加确诊数据
用groupby按国家分组,对确诊总病例列执行求和操作:
# 替换'Country'为国家列名,'Total Cases'为确诊总病例列名 merged_df = df.groupby('Country', as_index=False)['Total Cases'].sum()
如果还有其他需要保留的非数值列(比如国家代码、所属区域),可以用agg指定不同聚合逻辑,比如保留该列首次出现的值:
merged_df = df.groupby('Country').agg({ 'Total Cases': 'sum', 'Country Code': 'first', # 保留第一个出现的国家代码 'Region': 'first' # 保留第一个出现的区域信息 }).reset_index()
4. 验证合并结果
检查处理后的数据是否还存在重复国家:
print("合并后是否存在重复国家:", merged_df.duplicated('Country').any())
内容的提问来源于stack exchange,提问作者Olaye Fortune
相关产品推荐
相关产品推荐

