You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

m面骰子平均掷骰回报的最优停止准则求解技术问询

m面骰子平均掷骰回报的最优停止准则求解技术问询

大家好,我正在研究一个m面骰子的最优停止问题:我们可以无限次掷骰子,停止时获得的回报等于截至当时的平均掷骰结果,目标是找到一个最优阈值θ——当当前平均超过θ时就停止掷骰,以此最大化期望回报。

6面骰子的模拟结果

我先针对6面骰子做了模拟,得到如下数据:

阈值(θ)期望回报(x)范围
4.14.389 < x < 4.39
44.396 < x < 4.397
3.94.391 < x < 4.392
3.84.3976 < x < 4.398
3.74.397 < x < 4.3978

从模拟结果来看,6面骰子的最优阈值应该落在区间$(3.7, 3.9)$内。

我的初步推导思路

我首先尝试计算掷n次m面骰子后,平均超过阈值θ的概率,记为$P(m,n,\theta)$,推导得到的计算公式为:
$$P(m,n,\theta)=\frac{1}{m^n}\sum_{s=\lceil n\theta \rceil}{mn}\sum_{k=0}{\lfloor\frac{s-n}{m}\rfloor}(-1)^k\binom{n}{k}\binom{s-mk-1}{n-1}$$

接着我定义了$Q(m,n,\theta)$:它表示恰好掷n次m面骰子后才超过阈值θ的概率。举个具体例子,$Q(6,3,3.8)=9/216=1/24$,对应的9种符合条件的掷骰序列是:

  • (1,5,6),(1,6,5),(1,6,6)
  • (2,4,6),(2,5,5),(2,5,6)
  • (3,3,6),(3,4,5),(3,4,6)

之后我定义了$R(m,n,\theta)$:表示掷n次后停止(此时刚好超过θ)的期望回报。那么整体的期望回报$R(m,\theta)$可以表示为:
$$R(m,\theta)=\sum_{n=1}^{\infty}Q(m,n,\theta)R(m,n,\theta)$$

当前遇到的问题

我目前卡在了如何推导$Q(m,n,\theta)$和$R(m,n,\theta)$的闭合表达式上。如果能得到这两个表达式,就可以通过合适的搜索方法找到使$R(m,\theta)$最大化的θ值。

希望社区的各位能给我一些帮助、思路或者相关的推导方向!

备注:内容来源于stack exchange,提问作者Sam

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.22 12:32:59