关于分性别运行增收政策对儿童健康影响DID模型的技术问询
双重差分模型(DID)分析父母收入政策对儿童健康影响的疑问解答
研究背景与问题
我希望探究一项提高父母收入的政策是否会对母亲组和父亲组的儿童健康产生影响,计划采用双重差分(Diff-in-Diff,DID)模型进行分析。使用的回归模型如下:
模型公式:$ChildHealth_{i,t} = \beta_0 + \beta_1 Post_t + \beta_2 Treated_i + \beta_3 Post_t \times Treated_i + \beta_4 X_{i,t} + \epsilon_{i,t}$
其中:
Post:政策实施后的虚拟变量Treated:接受政策干预组的虚拟变量X:父母特征控制变量向量(如年龄、性别、学历等)
当前有三个核心疑问:
- 分别针对母亲和父亲运行该回归模型是否合理?
- 是否需要加入儿童特征控制变量向量(如年龄、性别等)?
- 若家庭中有多名儿童且针对每名儿童分别运行回归,是否需要聚类标准误?该如何操作?
附带的分性别回归代码:
regress child_health post#treat mother_age qualification marital status, robust regress child_health post#treat father_age qualification marital status, robust
问题解答
1. 分父母性别运行DID模型的合理性
分性别运行回归完全合理,但要明确分组逻辑:
- 你需要对应定义母亲组的处理/控制组和父亲组的处理/控制组:比如母亲组的
Treated是母亲符合政策增收条件的家庭,控制组是母亲不符合的;父亲组则以父亲是否受政策影响来划分处理/控制组,不能仅替换回归中的父母特征变量。 - 这种分性别分析恰好匹配你的研究目标——识别政策对不同性别家长的异质性影响,能直接对比母亲、父亲受政策影响后,儿童健康的差异变化。
2. 是否需要加入儿童特征控制变量
非常建议加入儿童特征控制变量(年龄、性别、出生体重、既往健康状况等):
- 儿童自身特征是影响其健康的直接因素,遗漏这些变量会引发遗漏变量偏误,比如低龄儿童的健康指标波动本身更大,性别也可能与某些健康结果直接相关。
- 加入后能让模型估计的政策效应(交互项
Post×Treated的系数)更精准,排除儿童自身特征的干扰,聚焦政策通过父母收入传导的真实影响。
3. 多儿童样本的聚类标准误处理
必须聚类标准误,操作方法如下:
- 原因:同一家庭的多名儿童共享家庭层面的未观测特征(如家庭环境、父母养育方式等),会导致同一家庭内的儿童健康残差相关。不聚类的话标准误会被低估,直接导致统计推断错误。
- Stata操作:在回归命令中加入
cluster(家庭ID变量)(聚类到家庭层面),同时可以保留robust(也可仅用cluster,因为聚类标准误本身已包含异方差稳健性)。修改后的代码示例:
// 母亲组回归:加入儿童特征变量+家庭聚类 regress child_health post#treat mother_age qualification marital_status child_age child_sex, cluster(family_id) // 父亲组回归:加入儿童特征变量+家庭聚类 regress child_health post#treat father_age qualification marital_status child_age child_sex, cluster(family_id)
注:将family_id替换为你数据中代表家庭唯一标识的变量名,child_age、child_sex为儿童特征变量示例。
内容的提问来源于stack exchange,提问作者Lily Tee
相关产品推荐
相关产品推荐

