如何使用Pandas合并约翰霍普金斯新冠数据集中的两条刚果国家行
Pandas合并刚果相关国家行的实现方案
约翰霍普金斯新冠时间序列数据集中,两条刚果相关条目对应的Country/Region字段值分别为 Congo (Brazzaville)(刚果布)和 Congo (Kinshasa)(刚果金),可按以下步骤合并:
- 导入依赖并读取数据集
import pandas as pd # 此处以全局确诊时间序列数据为例,死亡、康复数据操作逻辑一致 df = pd.read_csv("time_series_covid19_confirmed_global.csv")
- 拆分日期列与非日期列
# 数据集前4列为固定属性列,后续均为日期统计列 non_date_cols = ["Province/State", "Country/Region", "Lat", "Long"] date_cols = [col for col in df.columns if col not in non_date_cols]
- 统一国家名称后分组求和
# 将两个刚果的国家名称统一替换为「刚果」 df["Country/Region"] = df["Country/Region"].replace( ["Congo (Brazzaville)", "Congo (Kinshasa)"], "刚果" ) # 按国家维度分组,对所有日期列的统计值求和 df_merged = df.groupby("Country/Region", as_index=False)[date_cols].sum()
如果后续需要用到经纬度字段,可单独为合并后的刚果行赋值:
# 取原刚果金的经纬度作为合并后刚果的经纬度,可按需调整为刚果布的数值 df_merged.loc[df_merged["Country/Region"] == "刚果", ["Lat", "Long"]] = df[df["Country/Region"] == "Congo (Kinshasa)"][["Lat", "Long"]].values[0]
格陵兰岛数据缺失说明
你没有遗漏数据,约翰霍普金斯数据集的统计规则为:格陵兰作为丹麦的自治领地,相关新冠数据全部计入丹麦条目下,不会单独拆分列出。
内容的提问来源于stack exchange,提问作者John
相关产品推荐
相关产品推荐

