比较均方误差:θ的两个估计量T₁与T₂性能分析
咱们先把问题里的已知条件明确下来:
设$X_{1}, X_{2}, \dots ,X_{n}$为独立同分布的随机变量,其概率密度函数为
$$f_{\theta}(x)=\frac{1}{\theta+1}e^{-\frac{x}{\theta+1}} \quad (x>0, \text{否则为0})$$
其中参数$\theta$的取值范围是$\theta \in [1,2]$。
问题里定义了两个估计量:
- 第一个估计量$T_1$是样本均值减1:
$$T_{1}(X_{1}, \dots , X_{n})=\frac{X_{1}+ \cdots +X_{n}}{n}-1 = \bar{X} - 1$$ - 第二个估计量$T_2$是$T_1$的截断版本,把$T_1$的取值限制在参数空间$[1,2]$内:
$$T_{2}(X_{1}, \dots , X_{n})=\min\left{2,\max\left{1,T_{1}(X_{1}, \dots,X_{n})\right}\right}$$
均方误差的核心公式
首先回忆一下,估计量的均方误差(MSE)可以分解为方差加偏差的平方:
$$MSE(T) = E\left[(T - \theta)^2\right] = Var(T) + \left[Bias(T)\right]^2$$
其中$Bias(T) = E[T] - \theta$是估计量的偏差。
计算$T_1$的均方误差
首先看$X_i$的分布:它服从参数为$\lambda=1/(\theta+1)$的指数分布,所以有:
- 期望:$E[X_i] = \theta+1$
- 方差:$Var(X_i) = (\theta+1)^2$
对于样本均值$\bar{X}$,我们有:
- $E[\bar{X}] = \theta+1$,因此$E[T_1] = E[\bar{X}] - 1 = \theta$,这说明$T_1$是无偏估计量,即$Bias(T_1)=0$
- $Var(T_1) = Var(\bar{X}) = \frac{Var(X_i)}{n} = \frac{(\theta+1)^2}{n}$
代入MSE公式,得到:
$$MSE(T_1) = \frac{(\theta+1)^2}{n}$$
计算$T_2$的均方误差并对比
$T_2$本质是对$T_1$做了截断处理,我们可以把它写成分段函数:
$$T_2 = \begin{cases}
1, & T_1 < 1 \
T_1, & 1 \leq T_1 \leq 2 \
2, & T_1 > 2
\end{cases}$$
把$MSE(T_2)$拆成三个区间的期望之和:
$$MSE(T_2) = E\left[(1-\theta)^2 \cdot I(T_1<1)\right] + E\left[(T_1-\theta)^2 \cdot I(1\leq T_1\leq2)\right] + E\left[(2-\theta)^2 \cdot I(T_1>2)\right]$$
这里$I(\cdot)$是指示函数,满足括号内条件时取1,否则取0。
对比$T_1$的MSE:
$$MSE(T_1) = E\left[(T_1-\theta)^2 \cdot I(T_1<1)\right] + E\left[(T_1-\theta)^2 \cdot I(1\leq T_1\leq2)\right] + E\left[(T_1-\theta)^2 \cdot I(T_1>2)\right]$$
两者的差值为:
$$MSE(T_2) - MSE(T_1) = E\left[((1-\theta)^2 - (T_1-\theta)^2)I(T_1<1)\right] + E\left[((2-\theta)^2 - (T_1-\theta)^2)I(T_1>2)\right]$$
我们分别化简这两项:
- 当$T_1<1$时:
$$(1-\theta)^2 - (T_1-\theta)^2 = (1-T_1)(1+T_1-2\theta)$$
因为$T_1<1$,所以$1-T_1>0$;又因为$\theta\geq1$,$T_1<1$,所以$1+T_1-2\theta \leq 1+1-2*1=0$,因此这一项的整体是负数,对应的期望也是负数。 - 当$T_1>2$时:
$$(2-\theta)^2 - (T_1-\theta)^2 = (2-T_1)(2+T_1-2\theta)$$
因为$T_1>2$,所以$2-T_1<0$;又因为$\theta\leq2$,$T_1>2$,所以$2+T_1-2\theta \geq2+2-2*2=0$,因此这一项的整体也是负数,对应的期望也是负数。
这就意味着$MSE(T_2) - MSE(T_1) < 0$,也就是**$T_2$的均方误差严格小于$T_1$的均方误差**。
从直观上理解也很简单:$T_1$虽然是无偏估计,但它可能会输出参数空间$[1,2]$之外的取值,而这些“出格”的估计值对应的平方误差会比截断到边界后的平方误差更大(比如当$T_1<1$且$\theta\geq1$时,$(T_1-\theta)2$肯定比$(1-\theta)2$大;当$T_1>2$且$\theta\leq2$时,$(T_1-\theta)2$肯定比$(2-\theta)2$大),截断后这部分的误差被缩小了,中间区域的误差和$T_1$一致,所以整体MSE自然更小。
内容的提问来源于stack exchange,提问作者Andrei

