随时间动态选币规则下硬币选择概率的长期期望与方差计算及相关不等式验证
嘿,我来帮你拆解这个问题——这其实是个典型的贝叶斯更新马尔可夫链模型,咱们一步步来梳理清楚:
一、模型核心定义
首先把整个系统的概率规则明确下来,避免混淆:
- 单硬币的固定偏置:每个硬币$x \in {1,2,...,n}$有固定的抛币概率,$P_x(H) > 0$,$P_x(T) = 1-P_x(H) > 0$,这个概率和试验次数无关,是硬币本身的属性。
- 第i次试验的硬币选择先验:$P_i(x)$是第i次选到硬币x的概率,满足$\sum_{x=1}^n P_i(x) = 1$。
- 第i次试验的抛币结果概率:$P_i(H) = \sum_{x=1}^n P_i(x)P_x(H)$,$P_i(T) = 1-P_i(H)$,这是基于当前硬币选择概率计算出的整体抛H/T的概率。
- 后验更新规则:
- 如果第i次抛出H,第i+1次的硬币选择概率会更新为:
$$P_{i+1,i/H}(x) = \frac{P_i(x)P_x(H)}{P_i(H)}$$ - 如果第i次抛出T,更新规则变为:
$$P_{i+1,i/T}(x) = \frac{P_i(x)P_x(T)}{P_i(T)}$$
- 如果第i次抛出H,第i+1次的硬币选择概率会更新为:
二、$E[P_i(x)]$的高效计算方法
这里有个非常关键的结论:对于任意试验次数i,$E[P_i(x)]$始终等于初始值$P_1(x)$,不会随i变化。咱们来推导一下为什么:
首先,$P_{i+1}(x)$是一个随机变量,它的取值取决于第i次的抛币结果,所以期望可以拆分为两种情况的加权和:
$$
E[P_{i+1}(x)] = E\left[ P_{i+1,i/H}(x) \cdot I(H) + P_{i+1,i/T}(x) \cdot I(T) \right]
$$
其中$I(H)$是第i次抛H的指示变量(抛H时取1,否则取0),$I(T)$同理。
把更新规则代入展开:
$$
\begin{align*}
E[P_{i+1}(x)] &= P_x(H) \cdot E\left[ \frac{P_i(x) \cdot I(H)}{P_i(H)} \right] + P_x(T) \cdot E\left[ \frac{P_i(x) \cdot I(T)}{P_i(T)} \right]
\end{align*}
$$
现在看条件期望:在给定第i次的硬币选择概率$P_i(x)$的情况下,$I(H)$的条件期望就是$P_i(H)$,所以:
$$E\left[ \frac{P_i(x) \cdot I(H)}{P_i(H)} \mid P_i \right] = P_i(x)$$
同理,$E\left[ \frac{P_i(x) \cdot I(T)}{P_i(T)} \mid P_i \right] = P_i(x)$
把条件期望代入后,递推式直接简化为:
$$E[P_{i+1}(x)] = P_x(H) \cdot E[P_i(x)] + P_x(T) \cdot E[P_i(x)] = E[P_i(x)]$$
这就意味着,从第一次试验开始,$E[P_i(x)]$就一直等于初始的$P_1(x)$,不管i多大都不会变。
三、$Var(P_i(x))$的计算方法
方差的计算没有闭合解,但可以通过递推或者蒙特卡洛模拟来高效计算:
递推法思路
定义$V_i(x) = Var(P_i(x)) = E[P_i(x)^2] - (E[P_i(x)])2$,因为$E[P_i(x)]=P_1(x)$是常数,所以只需要递推计算$E[P_i(x)2]$:
推导$E[P_{i+1}(x)^2]$的递推式:
$$
\begin{align*}
E[P_{i+1}(x)^2] &= P_x(H)^2 E\left[ \frac{P_i(x)^2}{P_i(H)} \right] + P_x(T)^2 E\left[ \frac{P_i(x)^2}{P_i(T)} \right]
\end{align*}
$$
(注:因为$I(H)$和$I(T)$互斥,交叉项为0,所以可以简化到这一步)
这个式子需要迭代计算,初始时$E[P_1(x)^2] = (P_1(x))2$(因为第一次试验的$P_1(x)$是确定值,方差为0),之后每一步都需要计算$\frac{P_i(x)2}{P_i(H)}$和$\frac{P_i(x)^2}{P_i(T)}$的期望。
蒙特卡洛模拟法(更实用)
如果n较大或者递推计算太复杂,蒙特卡洛模拟是更高效的选择:
- 初始化大量样本(比如10000个),每个样本的初始硬币选择概率都是给定的$P_1(x)$。
- 对每个样本,模拟前i次的抛币和概率更新过程,记录每次更新后的$P_k(x)$。
- 统计所有样本在第i次试验时$P_i(x)$的均值(用来验证期望恒等于初始值)和方差,这就是方差的估计值。
四、关于长期期望不等式的验证
你之前猜想“当$P_1(x=1) \approx 1$时,长期$E[P_i(x=1)] \geq P_1(x=1)$”,但根据咱们上面的推导,这个猜想是不成立的——$E[P_i(x=1)]$始终等于$P_1(x=1)$,不会大于也不会小于。
可能你是把“样本路径”和“期望”搞混了:有些样本路径下,$P_i(x=1)$会随着抛币结果变大,有些会变小,但所有路径的平均值刚好等于初始值。举个简单的例子:
假设n=2,$P_1(x=1)=0.9$,$P_1(x=2)=0.1$;硬币1的$P_1(H)=0.6$,硬币2的$P_2(H)=0.4$。第一次抛H的概率是$0.90.6+0.10.4=0.58$,此时$P_2(x=1)=(0.90.6)/0.58≈0.931$;抛T的概率是0.42,此时$P_2(x=1)=(0.90.4)/0.42≈0.857$。计算期望:$0.580.931 + 0.420.857≈0.9$,刚好等于初始值。
备注:内容来源于stack exchange,提问作者Neijal Kanderbalt

