如何利用子群体统计量估算未知总体规模N?
首先得给你点个赞,你的直觉完全在点子上!我们可以把问题拆成两步:先估算每个子群体的大小n = N/k,再乘以子群数量k就能得到总体规模N。下面我给你拆解两种贴合你直觉的估算方法,还有具体的计算步骤:
方法一:利用子群均值的离散程度估算
你提到“子群均值越集中,N越大”,这个可以用统计学里的均值标准误来量化:
理论上,每个子群的均值$\bar{X}_i$的方差等于总体方差$\sigma^2$除以子群大小
n,也就是$\text{Var}(\bar{X}_i) = \sigma^2 / n$。我们可以用两个统计量来替换未知的理论值:
- 子群均值的样本方差:计算这k个子群均值的离散程度,公式是:
$S_{\bar{X}}^2 = \frac{1}{k-1}\sum_{i=1}^k (\bar{X}_i - \bar{\bar{X}})^2$
这里$\bar{\bar{X}}$是所有子群均值的平均值,这个值就是$\text{Var}(\bar{X}_i)$的无偏估计。 - 合并总体方差估计:用所有子群的标准差来估计总体方差$\sigma2$,因为每个子群的样本方差$s_i2$都是$\sigma^2$的无偏估计,所以直接取平均就行:
$S_p^2 = \frac{1}{k}\sum_{i=1}^k s_i^2$
- 子群均值的样本方差:计算这k个子群均值的离散程度,公式是:
把这两个值代入理论公式,就能解出子群大小的估计值:
$\hat{n} = \frac{S_p2}{S_{\bar{X}}2}$
最后总体规模就是$\hat{N} = k \times \hat{n}$
完全符合你的直觉:如果子群均值越集中,$S_{\bar{X}}^2$就越小,算出来的$\hat{n}$就越大,对应的N自然也就越大。
方法二:利用子群标准差的离散程度估算
你说的“子群标准差越接近,N越大”也能转化成量化方法:
对于正态分布的样本,子群样本方差$s_i2$的方差是$\frac{2\sigma4}{n-1}$,也就是说,子群大小
n越大,各个子群的方差$s_i^2$就越接近(方差越小)。同样用两个统计量替换理论值:
- 子群方差的样本方差:计算k个子群方差的离散程度:
$S_{s2}2 = \frac{1}{k-1}\sum_{i=1}^k (s_i^2 - S_p2)2$
这里$S_p^2$还是刚才的合并方差。 - 用$(S_p2)2$来估计$\sigma^4$
- 子群方差的样本方差:计算k个子群方差的离散程度:
代入理论公式解出子群大小:
$\hat{n} = 1 + \frac{2(S_p2)2}{S_{s2}2}$
总体规模依旧是$\hat{N} = k \times \hat{n}$
这个方法也贴合你的直觉:子群标准差越接近,$S_{s2}2$就越小,算出来的$\hat{n}$就越大,N也就越大。
实践建议
- 如果k比较大(比如k≥5),两种方法的结果都会比较可靠,你可以取两者的平均值作为最终估计;
- 如果k很小,方法一的稳定性可能更好,因为子群均值的样本方差自由度(k-1)会比子群方差的样本方差自由度更高;
- 注意:这两种方法都假设子群是独立随机划分的,而且总体确实服从正态分布,如果你的数据不符合这两个前提,估计结果可能会有偏差。
备注:内容来源于stack exchange,提问作者Golden Rockefeller

