You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

无模型强化学习中SARSA算法的状态转移相关疑问

SARSA算法中状态观测的问题

兄弟,你的思路完全正确!在无模型强化学习(比如SARSA这类算法)里,我们完全不需要预先掌握状态转移概率P{next state | current state = s0}——这恰恰是无模型方法的核心亮点!

具体来说,当你在状态s下执行动作a后:

  • 你根本不用自己去计算下一个状态s',只需要和环境做交互,直接从环境的反馈里读取这个新状态s'就好
  • 与此同时,你还会拿到对应的即时奖励r,这两个信息(s'和r)就是更新SARSA的Q值时所需要的全部观测数据

举个直观的例子:假设你用SARSA训练一个贪吃蛇AI

  • 当前状态s是蛇的位置、食物的位置、游戏边界信息
  • 执行动作a(比如“向上移动”)
  • 游戏环境(也就是贪吃蛇的运行逻辑)会直接返回新的游戏状态s'(蛇移动后的位置、食物是否被吃掉),以及这次动作的奖励r(吃到食物加5分,撞墙扣20分)

这种“边试错边观测”的模式,正是无模型强化学习和有模型强化学习最核心的区别:有模型方法需要先手动或者通过学习建立状态转移的概率模型,而无模型方法直接从和环境的实时交互中获取所有必要的信息,完全不需要依赖预先的转移概率公式。

内容的提问来源于stack exchange,提问作者wrek

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.27 10:06:09