如何在R中将多轮调查数据合并为面板数据?
世界银行纵向调查面板数据处理问题
背景
- 正在分析一项世界银行的纵向调查,涉及约2000户家庭(每轮参与户数递减),调查共11轮,每轮按问题主题分为6-8个数据集。目标是将这些数据转换为规范的面板数据格式,按主题合并所有轮次的数据。
- 数据格式存在差异:早期轮次(如第1轮)的分类变量取值为全称,后期轮次(如第9轮)改为数字编码,但二者对应同一问题。
- 单轮数据示例(第1轮):
head(round1.csv)ID INCOME SOURCE ANSWER CHANGE 101 1.Business 1. YES 3. Reduced 101 2.Pension 2. NO 102 1.Business 1. YES 2. No change 102 2. Assistance 1. YES 3. Reduced
待解决的核心问题
- 如何合并数量较多的多个数据框?
- 如何将数据转换为每轮每个ID仅出现一次的格式?
仅关注是否获得收入来源时,预期的格式如下,但不清楚包含收入变化变量时该如何设计结构:WAVE ID Business Pension 1 101 1. YES 1. NO 1 102 1. YES 1. YES 2 101 1. NO 1. YES 2 102 1. YES 1. YES - 如何处理权重问题?每轮的其中一个数据集包含权重,部分权重缺失,且随着每轮参与家庭减少,权重会发生变化;可以筛选出参与所有轮次的家庭以简化处理。
已尝试的资源
曾在Stack Overflow查找相关解决方案,但认为自身问题与现有案例不符。
内容的提问来源于stack exchange,提问作者Kamila
相关产品推荐
相关产品推荐

