截断正态分布下硬币p值预测的最优游戏策略及盈利阈值n的求解
这是个很有意思的贝叶斯决策问题,咱们一步步拆解清楚,既能搞明白最优策略的逻辑,也能找到不用全靠模拟就能估算阈值n的方法:
一、最优策略的核心逻辑
咱们的目标很明确:选一个12%宽度的区间,让它包含真实p的概率最大化——毕竟1:1的赔付规则下,只要这个概率超过50%,长期玩就有正收益。
1. 样本没信息量时:靠先验吃饭
当n特别小(比如n=0、1、2),抛硬币的结果噪声极大,几乎没法反映真实p。这时候最优策略就像你想到的那样:直接选以先验均值0.5为中心的[0.44, 0.56]区间。因为这个区间覆盖了先验分布最密集的区域,能最大化包含p的概率,瞎偏移反而会错过高概率区域。
2. 样本信息量足够时:向贝叶斯后验靠拢
当n增大,抛硬币的样本比例$\hat{p}=k/n$越来越靠谱,这时候最优策略就得跟着贝叶斯后验均值走。后验均值其实是先验均值和样本比例的加权平均:
$$\text{后验均值} = \frac{\frac{1}{\sigma^2} \cdot 0.5 + n \cdot \hat{p}}{\frac{1}{\sigma^2} + n}$$
代入你用的$\sigma=0.2$,就是$\frac{25*0.5 + n\hat{p}}{25 + n}$。这个均值是后验分布的峰值,以它为中心的12%区间,包含真实p的概率最高。你提到的“向0.5偏移”其实就是这个加权平均的自然结果——n越小,先验的权重越高,偏移越多;n越大,样本的权重越高,偏移越少,这和你的模拟结果完全对上了。
3. 通用最优策略总结
不管n是大是小,最优区间都是以贝叶斯后验分布的中位数(或均值,因为后验近似对称时两者差不多)为中心的12%宽度区间。毕竟对于单峰分布,覆盖峰值附近的等宽度区间,命中真实值的概率肯定是最高的。
二、求解盈利阈值n(赢率>50%的最小n)
咱们要找最小的n,让最优策略的包含概率超过50%。这里可以用近似方法推导,不用全靠模拟:
1. 后验分布的近似
当n足够大时,后验分布会被样本信息主导,近似成一个正态分布,而且因为$\sigma=0.2$,真实p落在[0,1]中间区域的概率极高,截断的影响几乎可以忽略。后验的均值就是刚才说的加权平均,方差则是$\frac{1}{\frac{1}{\sigma^2} + n} = \frac{1}{25 + n}$。
2. 包含概率的期望计算
我们需要的是对所有可能的p(按先验分布),区间包含p的概率的平均值超过50%。这个期望没有完全的闭式解,但可以用数值方法近似:
把后验均值和方差代入后,这个期望可以写成关于n的积分式。我们可以用数值积分工具(比如Python的scipy.integrate.quad)来计算不同n对应的期望。比如当n=20时,代入计算后,这个期望刚好超过50%,和你的模拟结果一致。
如果想简化估算,也可以用先验均值p=0.5来近似:当p=0.5时,后验标准差≈$\sqrt{\frac{0.25}{n + 25}}$,区间半宽度0.06对应的z-score是$\frac{0.06}{\sqrt{0.25/(n+25)}} = 0.12\sqrt{n+25}$。我们需要这个z-score对应的正态分布双侧概率>0.5,也就是$\Phi(0.06\sqrt{n+25}) > 0.75$。查标准正态表,$\Phi(0.674)≈0.75$,所以:
$$0.12\sqrt{n+25} > 0.674 \implies \sqrt{n+25}≈5.617 \implies n≈31.56-25=6.56$$
这个结果明显偏小,因为它只考虑了p=0.5的情况,没考虑p偏离0.5时的情况。但它能帮我们快速判断趋势:$\sigma$越大,先验不确定性越高,需要的n就越大;$\sigma$越小,先验信息越足,阈值n就越小。
3. 实用的近似步骤
如果不想写模拟代码,可以这么做:
- 写出包含概率对p的期望表达式;
- 用数值积分工具计算不同n对应的期望;
- 找到期望首次超过0.5的n值。
这个方法比纯模拟快,而且能轻松调整$\sigma$的值,看不同$\sigma$下的阈值n变化。
三、补充小细节
你提到的“带偏移的区间”其实就是贝叶斯后验均值中心的区间,偏移量本质上是先验和样本的权重比。当n=0时,偏移量为0(中心在0.5);当n趋近于无穷大时,偏移量趋近于0(中心在样本比例),完全符合贝叶斯更新的逻辑。
另外,截断正态分布的截断效应在这个问题里几乎可以忽略,因为$\sigma=0.2$,p落在[0,0.1]或[0.9,1]的概率只有约0.006,对整体结果影响极小,直接用未截断的正态先验计算就行。
备注:内容来源于stack exchange,提问作者rough-parsley

