带样本权重pesofit的数据集:如何正确统计各区域薪资数量?
关于样本权重在区域薪资数量统计中的使用说明
核心结论
- 如果你的目标是统计样本中各地理区域的观测记录数(即数据里每个
ireg下有多少条薪资数据):直接统计行数即可,不需要使用pesofit。 - 如果你的目标是估计总体中各地理区域的实际个体数量(该样本通过
pesofit调整了细分群体代表性,用于推断总体):必须对pesofit求和,才能得到无偏的总体估计值。
具体操作方法(基于R语言,使用dplyr包)
1. 统计样本中各区域的观测行数
library(dplyr) # 按ireg分组,统计每组的记录行数 sample_region_count <- data_shape %>% group_by(ireg) %>% summarise(sample_record_count = n()) # 查看结果 head(sample_region_count)
2. 估计总体中各区域的个体数量(使用样本权重)
# 按ireg分组,求和pesofit得到总体规模估计值 population_region_estimate <- data_shape %>% group_by(ireg) %>% summarise(population_estimate = sum(pesofit)) # 查看结果 head(population_region_estimate)
内容的提问来源于stack exchange,提问作者io_boh
相关产品推荐
相关产品推荐

