强化学习策略疑问:特定状态s下动作概率之和为何不等于1?
问题解答

- 你图里圈出的那组概率是错误计算的结果,并非符合Softmax策略的正确动作概率。
- 按照强化学习中Softmax策略的公式,动作概率的计算应为
P(a|s) = exp(Q(s,a)) / Σ(exp(Q(s,a')))(其中a'遍历当前状态下的所有动作):- 先计算各Q值的指数:
exp(1.0)≈2.718,exp(0.5)≈1.649(两个0.5的Q值对应结果一致) - 求和得到分母:
2.718 + 1.649 + 1.649 ≈ 6.016 - 计算各动作概率:
2.718/6.016≈0.452,1.649/6.016≈0.274,1.649/6.016≈0.274 - 这三个概率相加的结果是1,完全符合“特定状态下所有动作概率之和为1”的强化学习理论要求。
- 先计算各Q值的指数:
- 图中手写的0.5、0.25、0.25是直接按Q值的比例(1:0.5:0.5)分配的概率,这不是Softmax的正确计算方式,属于手写失误。
内容的提问来源于stack exchange,提问作者tasos_koukos
相关产品推荐
相关产品推荐

