R语言如何向data frame添加年份第三变量实现人口数据多维度查询
R数据整理与查询解决方案
你需要先将数据整理为tidy长表格式,该格式无论是多条件查询还是后续对接仪表板筛选组件都更适配,操作步骤如下:
1. 数据格式标准化
整理后的总表统一保留4个字段,每个观测(特定年份、特定国家、特定年龄组的人口数据)占一行:
age_group:年龄组,和你现有分类(12岁以下、12-17岁等)保持一致country:国家名称year:年份(取值范围1990-2021)population:对应人口数值
如果你手里的分年份原始数据和现有汇总表结构一致(行是年龄组、列是国家),可以参考如下代码批量处理(以tidyverse套件为例):
library(tidyverse) # 单年份宽表转长表示例,假设1990年的宽表对象名为df_1990 df_1990_long <- df_1990 %>% pivot_longer( cols = -age_group, # 保留年龄组列,其余列均转换为国家字段 names_to = "country", values_to = "population" ) %>% mutate(year = 1990) # 补充当前表对应的年份 # 所有年份的长表处理完成后,合并为一张全量总表 total_pop_df <- bind_rows(df_1990_long, df_1991_long, ..., df_2021_long)
2. 多维度查询操作
总表整理完成后,使用filter函数即可快速实现多条件筛选,以你需要的「1998年至2008年加拿大55-64岁年龄段人口数」查询需求为例:
# 筛选符合条件的所有观测 target_data <- total_pop_df %>% filter( country == "加拿大", age_group == "55-64岁", year >= 1998 & year <= 2008 ) # 如需直接计算该时间段的人口总和,可追加求和逻辑 sum_pop <- target_data %>% pull(population) %>% sum()
内容的提问来源于stack exchange,提问作者Max Lim
相关产品推荐
相关产品推荐

