如何从原始数据集中提取仅包含阿尔及利亚相关数据的子集
筛选阿尔及利亚相关数据子集的操作方法
默认你使用的是Our World in Data的全量新冠疫情数据集,该类数据集统一使用location字段存储国家/地区名称作为标识,你可以根据自己常用的工具选择对应操作:
1. Python Pandas 操作方案
- 先读取原始全量数据集,再基于国家字段做等值筛选即可,参考代码如下:
import pandas as pd # 读取本地存储的原始OWID新冠数据CSV文件 raw_data = pd.read_csv("owid-covid-data.csv") # 按国家字段筛选阿尔及利亚数据,根据你数据集的字段取值选对应匹配规则 # 匹配英文名称: algeria_subset = raw_data[raw_data["location"] == "Algeria"] # 若数据集存储的是中文国家名,改用下方规则: # algeria_subset = raw_data[raw_data["location"] == "阿尔及利亚"] # 若使用ISO国家代码筛选,阿尔及利亚3位代码为DZA,2位为DZ # algeria_subset = raw_data[raw_data["iso_code"] == "DZA"] # 导出筛选后的子集到本地 algeria_subset.to_csv("algeria_covid_data.csv", index=False)
2. Excel/在线表格工具操作方案
- 打开原始数据集表格,选中所有列的表头行
- 点击菜单栏「数据」选项卡下的「筛选」功能,激活列筛选
- 点击
location(国家/地区)列的下拉箭头,在搜索框输入Algeria(或对应中文/ISO代码),勾选目标选项后确认 - 全选筛选后显示的所有内容,复制粘贴到新的空白表格中保存即可
3. R语言操作方案
- 参考代码如下:
library(dplyr) # 读取原始数据集 raw_data <- read.csv("owid-covid-data.csv") # 筛选阿尔及利亚数据 algeria_subset <- raw_data %>% filter(location == "Algeria") # 导出结果 write.csv(algeria_subset, "algeria_covid_data.csv", row.names = FALSE)
提示:如果筛选后无结果,先查看原始数据集的国家字段取值规范,调整匹配值即可。
内容的提问来源于stack exchange,提问作者djouah dhia
相关产品推荐
相关产品推荐

