无模型强化学习中SARSA算法的状态转移相关疑问
SARSA算法中状态观测的问题
兄弟,你的思路完全正确!在无模型强化学习(比如SARSA这类算法)里,我们完全不需要预先掌握状态转移概率P{next state | current state = s0}——这恰恰是无模型方法的核心亮点!
具体来说,当你在状态s下执行动作a后:
- 你根本不用自己去计算下一个状态
s',只需要和环境做交互,直接从环境的反馈里读取这个新状态s'就好 - 与此同时,你还会拿到对应的即时奖励
r,这两个信息(s'和r)就是更新SARSA的Q值时所需要的全部观测数据
举个直观的例子:假设你用SARSA训练一个贪吃蛇AI
- 当前状态
s是蛇的位置、食物的位置、游戏边界信息 - 执行动作
a(比如“向上移动”) - 游戏环境(也就是贪吃蛇的运行逻辑)会直接返回新的游戏状态
s'(蛇移动后的位置、食物是否被吃掉),以及这次动作的奖励r(吃到食物加5分,撞墙扣20分)
这种“边试错边观测”的模式,正是无模型强化学习和有模型强化学习最核心的区别:有模型方法需要先手动或者通过学习建立状态转移的概率模型,而无模型方法直接从和环境的实时交互中获取所有必要的信息,完全不需要依赖预先的转移概率公式。
内容的提问来源于stack exchange,提问作者wrek
相关产品推荐
相关产品推荐

