You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何合并Pandas DataFrame中重复国家行并累加新冠病例数据?

合并Pandas DataFrame中重复国家行并累加确诊数据

1. 导入依赖并读取数据

先确保已安装Pandas,再读取你的数据集:

import pandas as pd

# 替换为你的数据集文件路径
df = pd.read_csv('your_covid_data.csv')

2. 确认重复的国家记录

先排查哪些国家存在重复行,方便后续验证:

# 替换'Country'为你数据集中的国家列名称
duplicate_countries = df[df.duplicated('Country', keep=False)]['Country'].unique()
print("存在重复的国家:", duplicate_countries)

3. 合并重复行并累加确诊数据

用groupby按国家分组,对确诊总病例列执行求和操作:

# 替换'Country'为国家列名,'Total Cases'为确诊总病例列名
merged_df = df.groupby('Country', as_index=False)['Total Cases'].sum()

如果还有其他需要保留的非数值列(比如国家代码、所属区域),可以用agg指定不同聚合逻辑,比如保留该列首次出现的值:

merged_df = df.groupby('Country').agg({
    'Total Cases': 'sum',
    'Country Code': 'first',  # 保留第一个出现的国家代码
    'Region': 'first'         # 保留第一个出现的区域信息
}).reset_index()

4. 验证合并结果

检查处理后的数据是否还存在重复国家:

print("合并后是否存在重复国家:", merged_df.duplicated('Country').any())

内容的提问来源于stack exchange,提问作者Olaye Fortune

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.23 07:48:15