You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

关于在线SARSA(同策略强化学习)算法细节的理解澄清问询

关于SARSA算法细节的澄清梳理

我特意梳理了SARSA算法的核心细节,确保自己准确理解它和Q-learning的关键差异,主要参考了1994年9月那篇首次提出相关思路的经典文献《ON-LINE Q-LEARNING USING CONNECTIONIST SYSTEMS》(作者G. A. Rummery、M. Niranjan,编号CUED/F-INFENG/TR 166)——没错,就是维基百科里记载的那篇。

文献第6页明确指出了它和标准Q-learning的核心区别:

……与标准Q-learning的区别在于,使用所选动作对应的Qt+1,而非Q-learning中采用的贪心策略max(Qt+1 | a)

这个差异正是SARSA同策略特性的核心——而且有意思的是,“SARSA”这个术语其实是在这个更新规则定义的脚注里首次出现的。

另外我也对比了后续不少资料里常用的SARSA更新伪代码框架,典型结构如下:

begin
    initialize Q[S,A] arbitrarily
    observe current state s
    select action a using policy derived from Q (e.g., ε-greedy)
    repeat:
        take action a, observe reward r, next state s'
        select action a' using policy derived from Q (e.g., ε-greedy)
        Q[s,a] ← Q[s,a] + α(r + γQ[s',a'] - Q[s,a])
        s ← s'
        a ← a'
    until termination condition met
end

内容的提问来源于stack exchange,提问作者Alexey Burnakov

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 03:19:22