You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

强化学习策略疑问:特定状态s下动作概率之和为何不等于1?

问题解答

图中手写的Q值与概率计算

  • 你图里圈出的那组概率是错误计算的结果,并非符合Softmax策略的正确动作概率。
  • 按照强化学习中Softmax策略的公式,动作概率的计算应为 P(a|s) = exp(Q(s,a)) / Σ(exp(Q(s,a')))(其中a'遍历当前状态下的所有动作):
    • 先计算各Q值的指数:exp(1.0)≈2.718,exp(0.5)≈1.649(两个0.5的Q值对应结果一致)
    • 求和得到分母:2.718 + 1.649 + 1.649 ≈ 6.016
    • 计算各动作概率:2.718/6.016≈0.452,1.649/6.016≈0.274,1.649/6.016≈0.274
    • 这三个概率相加的结果是1,完全符合“特定状态下所有动作概率之和为1”的强化学习理论要求。
  • 图中手写的0.5、0.25、0.25是直接按Q值的比例(1:0.5:0.5)分配的概率,这不是Softmax的正确计算方式,属于手写失误。

内容的提问来源于stack exchange,提问作者tasos_koukos

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 01:42:04