Stata回归分析中自定义编码变量x1/x2/x3的分组对比疑问
Stata自定义种族编码变量(x1/x2/x3)的对比逻辑解析
首先明确:race变量的4个取值对应4个独立种族/族裔群体(暂记为群体1、群体2、群体3、群体4),先整理各变量的赋值对应关系:
变量-群体赋值对应表
| race取值 | 对应群体 | x1 | x2 | x3 |
|---|---|---|---|---|
| 1 | 群体1 | -0.5 | -1 | 1.5 |
| 2 | 群体2 | 0.5 | 1 | -0.5 |
| 3 | 群体3 | -1.5 | -1 | 1.5 |
| 4 | 群体4 | 1.5 | 1 | -2.5 |
x1:加权组间对比
x1的赋值是给不同群体赋予差异化权重的组间对比:
- 群体1、3归为一组,分别赋值-0.5、-1.5(权重比例1:3)
- 群体2、4归为另一组,分别赋值0.5、1.5(权重比例1:3)
回归中x1的系数反映加权组合的两组(群体11+群体33 vs 群体21+群体43)之间的差异,权重差异说明分析时更侧重群体3和群体4的影响。
x2:等权组间对比
x2是最直接的二分组对比:
- 群体1、3统一赋值-1,归为一组
- 群体2、4统一赋值1,归为另一组
回归中x2的系数反映两组群体(群体1+群体3 vs 群体2+群体4)的整体平均差异,组内各群体权重相同。
x3:梯度差异对比
x3的赋值体现群体间的梯度差异关系:
- 群体1、3赋值相同(1.5),作为基准参照组
- 群体2赋值-0.5,与基准组的差异程度中等
- 群体4赋值-2.5,与基准组的差异程度最大
回归中x3的系数反映群体与基准组的梯度差异对因变量的影响,即从群体1/3到群体2再到群体4,因变量呈现的线性变化趋势。
内容的提问来源于stack exchange,提问作者ArLo
相关产品推荐
相关产品推荐

