通过掷骰子模拟掷硬币:两类实验的总变差距离探究
硬币与骰子求和分布的总变差距离性质
好的,咱们来拆解一下这两个离散概率分布之间总变差距离(1-距离)的核心性质,先明确一下总变差距离的定义:
总变差距离 $TV(f,g) = \frac{1}{2}\sum_{x \in \mathbb{N}} |f(x) - g(x)|$,它衡量的是两个概率分布之间的“差异程度”。
接下来是具体性质:
对称性与有界性:总变差距离天生满足对称性,也就是 $TV(f,g) = TV(g,f)$,而且取值范围始终在 $[0,1]$ 之间。当两个分布完全一致时(比如抛0次硬币和抛0次骰子,结果都只有0),TV距离为0;由于两个实验都能取到0这个结果(全反面硬币、全0点骰子),它们的支撑集合(可能的取值)至少有交集,所以TV距离的最大值永远小于1。
中心极限定理下的收敛性:当实验次数 $n$ 和 $m$ 都趋向于无穷大时,如果我们调整两者的比例使得两个分布的均值和方差近似匹配,总变差距离会趋向于0。
- 硬币求和是二项分布 $Bin(n, 1/2)$,均值 $\mu_f = n/2$,方差 $\sigma_f^2 = n/4$;
- 骰子求和是 $m$ 个均匀分布在 ${0,1,...,k-1}$ 的独立变量之和,均值 $\mu_g = m*(k-1)/2$,方差 $\sigma_g^2 = m*(k^2-1)/12$;
只要让 $\mu_f \approx \mu_g$ 且 $\sigma_f^2 \approx \sigma_g^2$,根据中心极限定理,两个分布都会收敛到相同参数的正态分布,差异自然趋近于0。
有限样本的可计算性:对于有限的 $n$ 和 $m$,总变差距离可以通过枚举所有可能的求和结果直接计算:
- 硬币求和结果 $x$ 的范围是 $0 \leq x \leq n$,概率 $f(x) = \binom{n}{x}/2^n$;
- 骰子求和结果 $y$ 的范围是 $0 \leq y \leq m*(k-1)$,概率 $g(y)$ 是 $m$ 个骰子和为 $y$ 的组合数除以 $k^m$;
把所有 $x$ 对应的 $|f(x)-g(x)|$ 求和后除以2,就能得到TV距离。不过当 $n$ 和 $m$ 很大时,枚举会很繁琐,这时候可以用正态近似等方法来快速估算。
分布支撑的影响:两个分布的支撑重叠程度会直接影响TV距离的大小——重叠越多,距离越小。比如当 $n = m*(k-1)$ 时,硬币的支撑是 $0$ 到 $n$,骰子的支撑也是 $0$ 到 $n$,这时候两者的取值范围完全重合,TV距离会比支撑部分重叠时更小。
内容的提问来源于stack exchange,提问作者smapers
相关产品推荐
相关产品推荐

