ANOVA中残差方差/合并样本方差采用n-k作为分母的原因及期望推导咨询
嗨,我来帮你拆解这个问题~首先先明确核心点:在ANOVA的经典框架下,我们默认同方差假设——也就是所有组的总体方差是相等的,即 $\sigma_1^2 = \sigma_2^2 = ... = \sigma_k^2 = \sigma2$,而你提到的合并样本方差(残差方差),正是用来估计这个共同的总体方差$\sigma2$的。
接下来我们顺着你的推导往下补全,就能明白为什么用$n-k$做分母能得到无偏估计:
首先,每个组的样本方差$s_j^2 = \frac{1}{n_j-1}\sum_{i \in group\ j}(y_i - \bar{y}_j)2$,对于单个组来说,我们已经知道样本方差$s_j2$是该组总体方差$\sigma_j^2$的无偏估计,也就是 $E[s_j^2] = \sigma_j2$。而在同方差假设下,所有$\sigma_j2 = \sigma2$,所以每个组的$E[s_j2] = \sigma^2$。
把这个结论代入你写的期望式子:
$$
E\left[\frac{1}{n-k}\sum_{j=1}^{k}(n_j - 1)s_j^2\right] = \frac{1}{n-k}\sum_{j=1}^{k}(n_j - 1)E[s_j^2]
$$
因为每个$E[s_j^2] = \sigma2$,我们可以把$\sigma2$提出来:
$$
= \frac{1}{n-k} \times \sigma^2 \times \sum_{j=1}^{k}(n_j - 1)
$$
现在计算求和项$\sum_{j=1}^{k}(n_j - 1)$:它等于$\sum_{j=1}^k n_j - \sum_{j=1}^k 1 = n - k$(因为$\sum_{j=1}^k n_j$就是总观测数$n$,$\sum_{j=1}^k 1$是组数$k$)。
代入后就得到:
$$
= \frac{1}{n-k} \times \sigma^2 \times (n - k) = \sigma^2
$$
这样就证明了,用$n-k$作为分母时,合并样本方差的期望等于我们要估计的共同总体方差$\sigma^2$,也就是它是一个无偏估计——这和单样本方差用$n-1$做分母的逻辑完全一致:单样本中我们用样本均值$\bar{y}$消耗了1个自由度,所以分母是$n-1$;而这里我们对$k$个组分别计算了组均值$\bar{y}_j$,总共消耗了$k$个自由度,所以总自由度是$n - k$,用这个做分母才能保证无偏性。
最后回应你的疑问:你担心它不是总体方差,但在ANOVA的同方差假设下,它确实是所有组共享的那个总体方差的无偏估计。如果没有同方差假设,这个合并方差本质上是组内方差的加权平均,但ANOVA的核心前提之一就是同方差,所以我们默认它估计的是共同的$\sigma^2$。
备注:内容来源于stack exchange,提问作者Maciej Jałocha

