You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

MDP策略迭代算法中Rich Famous状态值54.2计算逻辑求教

问题排查
  • 第一个错误:使用的贝尔曼更新公式错误
    你写的V_2(RF) = V_1(RF) + gamma * Sum_s'[ p(s'|s,a)]*V(s')多了前一轮状态值的累加项,正确的策略评估阶段贝尔曼期望方程为:
    V_{k+1}(s) = R(s,a) + γ * Σ_{s'} P(s'|s,a) * V_k(s')
    其中R(s,a)是在状态s执行动作a获得的即时奖励,不需要额外叠加前一轮的V(s)。
  • 第二个错误:动作选择不符合当前迭代对应的策略
    你计算时默认选择了Save动作,但该轮迭代对应的策略下,RF状态要求执行的是Advertise动作,对应转移概率与Save动作完全不同。
  • 第三个错误:未同步计算所有状态的价值
    你默认所有状态的前一轮价值都是10,但策略评估是同步更新所有状态的价值,单独给RF的关联状态赋值10不符合迭代逻辑。该例题中当所有状态默认执行Advertise动作时,联立四个状态的贝尔曼方程组求解,最终得到的RF稳态价值正好是54.2,和课件标注一致。

内容的提问来源于stack exchange,提问作者Amsci Fi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 18:06:01