You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

寻求含虚拟自变量与混淆变量的回归断点设计公式

回归断点设计(RDD)带协变量的正确公式及解释

我明白你的困惑——很多基础教材里的线性回归公式确实没法直接套用到回归断点设计(RDD)里,因为RDD的核心逻辑和普通回归完全不同,尤其是处理变量D的定义方式。你需要的公式必须体现RDD的核心:处理变量D是由一个连续的「分配变量(Running Variable)」是否超过断点来决定的,而不是随机分配的虚拟变量。

首先明确RDD的核心要素

在RDD中,你的虚拟变量D不能是任意分组,它必须满足:
D = 1 当 R ≥ c,否则 D = 0
其中:

  • R:分配变量(比如考试分数、收入水平、申请截止日期的天数等,是连续变量)
  • c:断点值(比如及格线60分、补贴资格的收入阈值)

带混淆变量(协变量)的Sharp RDD公式(最常用的情况)

如果你的研究是Sharp RDD(即所有超过断点的个体都进入处理组,没超过的都在控制组,没有例外),带协变量的完整公式应该是:

Y = α + τ*D + β*X + γ*(R - c) + δ*D*(R - c) + ε

逐个解释变量和参数:

  • Y:你的连续因变量
  • D:处理虚拟变量(1=处理组,0=控制组),由D = I(R ≥ c)定义(I()是指示函数)
  • X:混淆变量(协变量)的矩阵(可以是多个变量),β是对应的系数向量,用来控制那些在断点前就存在的、可能影响Y的混杂因素
  • (R - c):中心化后的分配变量,用来控制断点附近R的线性趋势(这是RDD避免遗漏变量偏差的关键)
  • D*(R - c):处理变量和中心化分配变量的交互项,用来允许处理组和控制组的R-Y趋势不同(如果两组趋势相同,这个项可以省略,但建议保留以更严谨)
  • τ:你最关心的局部处理效应(LATE)——即断点附近个体的处理效应(RDD估计的是断点附近的因果效应,不是整体效应)
  • ε:随机误差项

为什么你之前的公式不适用?

你提到的Y = α + Dτ + Xβ + ε是普通线性回归的公式,它没有考虑RDD的核心:分配变量R的趋势。在RDD中,R本身可能和Y相关,如果不控制R的趋势,你估计的τ会被R的趋势混淆,得到的结果不是因果效应。

进阶调整:非线性趋势和Fuzzy RDD

  • 非线性趋势:如果你的分配变量R和Y的关系是非线性的(比如二次、三次),可以加入(R - c)的高次项,比如:
    Y = α + τ*D + β*X + γ1*(R - c) + γ2*(R - c)² + δ1*D*(R - c) + δ2*D*(R - c)² + ε
    
  • Fuzzy RDD:如果处理分配不是严格的(比如有些超过断点的个体没得到处理,有些没超过的却得到了),需要用两阶段最小二乘法(2SLS):
    1. 第一阶段:用I(R ≥ c)作为工具变量预测D:
      D = α1 + π*I(R ≥ c) + β1*X + γ1*(R - c) + δ1*I(R ≥ c)*(R - c) + ε1
      
    2. 第二阶段:用预测的D̂回归Y,同时加入协变量和趋势项:
      Y = α2 + τ*D̂ + β2*X + γ2*(R - c) + δ2*D̂*(R - c) + ε2
      

关于协变量的注意事项

  • 协变量X必须是前定变量(即在处理分配前就已经确定的变量,比如个体的年龄、性别、预处理的Y值等),不能是处理后的结果变量
  • 加入协变量的主要作用是提高估计的精度,而不是解决内生性(RDD的内生性解决依赖于断点附近的局部随机化)

内容的提问来源于stack exchange,提问作者user9235457

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.15 08:36:27