为何两种Bob掷20面骰子策略下,Alice获胜的概率结果不同?
嘿,我来帮你把这两个问题的核心差异掰明白——它们看起来都是Bob和20面骰打交道,但Bob的操作逻辑和决策自由度完全不一样,这就是概率结果不同的关键!
第一个问题:Bob固定掷两次,取最大值
先回顾第一个场景:Alice只掷一次30面骰,Bob则不管三七二十一先掷两次20面骰,直接取两次里的最大值,平局算Bob赢。这里Bob完全没有选择空间,操作是固定死的——必须掷两次,然后取最大。我们要算的就是“Alice的点数 > Bob两次掷出的最大值”的概率,最终结果$\frac{647}{1200}$是用全概率公式(LOTP)结合概率质量函数(pmf)推导出来的,思路就是对Alice每个可能的点数,计算Bob两次最大值都小于它的概率,再加权求和。
第二个问题:Bob可以看到Alice的点数后,针对性选择是否重掷
第二个场景就有门道了:Bob是先看到Alice掷出的点数,再盯着自己第一次的点数决定要不要重掷,而且他会用最优策略来尽量让Alice赢不了。这可不是简单的“取两次最大值”,因为Bob的重掷决策是有针对性的——他会判断当前点数能不能打过Alice,再决定要不要重新来一次。
第二个问题的概率推导($\frac{17}{30}$的由来)
咱们一步步拆解这个推导过程:
先拆分Alice的点数情况:
- Alice掷出大于20的概率是$\frac{10}{30}=\frac{1}{3}$,这时候Bob的20面骰最多掷出20,肯定超不过Alice,所以Alice必赢,也就是$P(W|A>20)=1$。
- Alice掷出≤20的概率是$\frac{20}{30}=\frac{2}{3}$,这时候就得仔细分析Bob的最优策略了。
先搞懂Bob的决策逻辑:Bob会算“如果我保留当前点数b,Alice赢的概率”,也就是$P(W|B=b)=1-\frac{b}{30}$(因为Alice只要掷出b+1到30就能赢,一共30-b个点数)。Bob的目标是最小化Alice的胜率,所以他会选择重掷,当且仅当“保留当前点数时Alice赢的概率”大于“重掷后Alice赢的概率”——毕竟重掷能让他有机会拿到更好的点数。
找到重掷的阈值:先算出如果Bob重掷,Alice赢的概率是多少?当Alice点数≤20时,Bob重掷一次相当于重新得到一个均匀的20面点数,此时Alice赢的概率是$\frac{19}{40}$(推导:先排除平局的$\frac{1}{20}$,剩下$\frac{19}{20}$的情况里,Alice和Bob赢的概率各占一半,也就是$\frac{19}{20}×\frac{1}{2}=\frac{19}{40}=\frac{39}{60}$)。
解不等式$1-\frac{b}{30}>\frac{39}{60}$,得到$b≤10.5$,所以Bob的最优策略就出来了:当第一次掷出的点数≤10时,选择重掷;点数≥11时,直接保留当前点数。
最终计算Alice的总胜率:
- 当Bob第一次掷出≤10(概率$\frac{10}{20}=\frac{1}{2}$),他会重掷,此时Alice赢的概率是$\frac{39}{60}$;
- 当Bob第一次掷出≥11(概率$\frac{10}{20}=\frac{1}{2}$),他保留点数,此时Alice赢的概率是$\frac{1}{10}\sum_{b=11}^{20}(1-\frac{b}{30})=\frac{29}{60}$;
- 结合Alice点数>20的情况,最终总胜率就是:
$$
P(W)=\frac{1}{3}×1 + \frac{2}{3}×(\frac{1}{2}×\frac{39}{60}+\frac{1}{2}×\frac{29}{60})=\frac{17}{30}
$$
核心差异:被动固定操作 vs 主动最优决策
为什么两个问题结果不一样?核心就在Bob的行动规则:
- 第一个问题里,Bob的两次掷骰是无差别、被动的——不管第一次掷出1还是19,他都会掷第二次,然后取最大值,哪怕第二次掷出更小的数也不影响;
- 第二个问题里,Bob是有选择、主动的——他只会在第一次掷出小点数(≤10)时才重掷,掷出大点数(≥11)就直接保留,不会浪费机会去掷第二次。这种针对性的策略让Bob的“有效点数”分布比第一个场景更优,最终导致Alice的胜率和第一个场景不同。
备注:内容来源于stack exchange,提问作者nezam jazayeri

