寻求含虚拟自变量与混淆变量的回归断点设计公式
回归断点设计(RDD)带协变量的正确公式及解释
我明白你的困惑——很多基础教材里的线性回归公式确实没法直接套用到回归断点设计(RDD)里,因为RDD的核心逻辑和普通回归完全不同,尤其是处理变量D的定义方式。你需要的公式必须体现RDD的核心:处理变量D是由一个连续的「分配变量(Running Variable)」是否超过断点来决定的,而不是随机分配的虚拟变量。
首先明确RDD的核心要素
在RDD中,你的虚拟变量D不能是任意分组,它必须满足:D = 1 当 R ≥ c,否则 D = 0
其中:
R:分配变量(比如考试分数、收入水平、申请截止日期的天数等,是连续变量)c:断点值(比如及格线60分、补贴资格的收入阈值)
带混淆变量(协变量)的Sharp RDD公式(最常用的情况)
如果你的研究是Sharp RDD(即所有超过断点的个体都进入处理组,没超过的都在控制组,没有例外),带协变量的完整公式应该是:
Y = α + τ*D + β*X + γ*(R - c) + δ*D*(R - c) + ε
逐个解释变量和参数:
Y:你的连续因变量D:处理虚拟变量(1=处理组,0=控制组),由D = I(R ≥ c)定义(I()是指示函数)X:混淆变量(协变量)的矩阵(可以是多个变量),β是对应的系数向量,用来控制那些在断点前就存在的、可能影响Y的混杂因素(R - c):中心化后的分配变量,用来控制断点附近R的线性趋势(这是RDD避免遗漏变量偏差的关键)D*(R - c):处理变量和中心化分配变量的交互项,用来允许处理组和控制组的R-Y趋势不同(如果两组趋势相同,这个项可以省略,但建议保留以更严谨)τ:你最关心的局部处理效应(LATE)——即断点附近个体的处理效应(RDD估计的是断点附近的因果效应,不是整体效应)ε:随机误差项
为什么你之前的公式不适用?
你提到的Y = α + Dτ + Xβ + ε是普通线性回归的公式,它没有考虑RDD的核心:分配变量R的趋势。在RDD中,R本身可能和Y相关,如果不控制R的趋势,你估计的τ会被R的趋势混淆,得到的结果不是因果效应。
进阶调整:非线性趋势和Fuzzy RDD
- 非线性趋势:如果你的分配变量
R和Y的关系是非线性的(比如二次、三次),可以加入(R - c)的高次项,比如:Y = α + τ*D + β*X + γ1*(R - c) + γ2*(R - c)² + δ1*D*(R - c) + δ2*D*(R - c)² + ε - Fuzzy RDD:如果处理分配不是严格的(比如有些超过断点的个体没得到处理,有些没超过的却得到了),需要用两阶段最小二乘法(2SLS):
- 第一阶段:用
I(R ≥ c)作为工具变量预测D:D = α1 + π*I(R ≥ c) + β1*X + γ1*(R - c) + δ1*I(R ≥ c)*(R - c) + ε1 - 第二阶段:用预测的
D̂回归Y,同时加入协变量和趋势项:Y = α2 + τ*D̂ + β2*X + γ2*(R - c) + δ2*D̂*(R - c) + ε2
- 第一阶段:用
关于协变量的注意事项
- 协变量
X必须是前定变量(即在处理分配前就已经确定的变量,比如个体的年龄、性别、预处理的Y值等),不能是处理后的结果变量 - 加入协变量的主要作用是提高估计的精度,而不是解决内生性(RDD的内生性解决依赖于断点附近的局部随机化)
内容的提问来源于stack exchange,提问作者user9235457
相关产品推荐
相关产品推荐

