m面骰子平均掷骰回报的最优停止准则求解技术问询
大家好,我正在研究一个m面骰子的最优停止问题:我们可以无限次掷骰子,停止时获得的回报等于截至当时的平均掷骰结果,目标是找到一个最优阈值θ——当当前平均超过θ时就停止掷骰,以此最大化期望回报。
6面骰子的模拟结果
我先针对6面骰子做了模拟,得到如下数据:
| 阈值(θ) | 期望回报(x)范围 |
|---|---|
| 4.1 | 4.389 < x < 4.39 |
| 4 | 4.396 < x < 4.397 |
| 3.9 | 4.391 < x < 4.392 |
| 3.8 | 4.3976 < x < 4.398 |
| 3.7 | 4.397 < x < 4.3978 |
从模拟结果来看,6面骰子的最优阈值应该落在区间$(3.7, 3.9)$内。
我的初步推导思路
我首先尝试计算掷n次m面骰子后,平均超过阈值θ的概率,记为$P(m,n,\theta)$,推导得到的计算公式为:
$$P(m,n,\theta)=\frac{1}{m^n}\sum_{s=\lceil n\theta \rceil}{mn}\sum_{k=0}{\lfloor\frac{s-n}{m}\rfloor}(-1)^k\binom{n}{k}\binom{s-mk-1}{n-1}$$
接着我定义了$Q(m,n,\theta)$:它表示恰好掷n次m面骰子后才超过阈值θ的概率。举个具体例子,$Q(6,3,3.8)=9/216=1/24$,对应的9种符合条件的掷骰序列是:
- (1,5,6),(1,6,5),(1,6,6)
- (2,4,6),(2,5,5),(2,5,6)
- (3,3,6),(3,4,5),(3,4,6)
之后我定义了$R(m,n,\theta)$:表示掷n次后停止(此时刚好超过θ)的期望回报。那么整体的期望回报$R(m,\theta)$可以表示为:
$$R(m,\theta)=\sum_{n=1}^{\infty}Q(m,n,\theta)R(m,n,\theta)$$
当前遇到的问题
我目前卡在了如何推导$Q(m,n,\theta)$和$R(m,n,\theta)$的闭合表达式上。如果能得到这两个表达式,就可以通过合适的搜索方法找到使$R(m,\theta)$最大化的θ值。
希望社区的各位能给我一些帮助、思路或者相关的推导方向!
备注:内容来源于stack exchange,提问作者Sam

