关于在线SARSA(同策略强化学习)算法细节的理解澄清问询
关于SARSA算法细节的澄清梳理
我特意梳理了SARSA算法的核心细节,确保自己准确理解它和Q-learning的关键差异,主要参考了1994年9月那篇首次提出相关思路的经典文献《ON-LINE Q-LEARNING USING CONNECTIONIST SYSTEMS》(作者G. A. Rummery、M. Niranjan,编号CUED/F-INFENG/TR 166)——没错,就是维基百科里记载的那篇。
文献第6页明确指出了它和标准Q-learning的核心区别:
……与标准Q-learning的区别在于,使用所选动作对应的Qt+1,而非Q-learning中采用的贪心策略max(Qt+1 | a)
这个差异正是SARSA同策略特性的核心——而且有意思的是,“SARSA”这个术语其实是在这个更新规则定义的脚注里首次出现的。
另外我也对比了后续不少资料里常用的SARSA更新伪代码框架,典型结构如下:
begin initialize Q[S,A] arbitrarily observe current state s select action a using policy derived from Q (e.g., ε-greedy) repeat: take action a, observe reward r, next state s' select action a' using policy derived from Q (e.g., ε-greedy) Q[s,a] ← Q[s,a] + α(r + γQ[s',a'] - Q[s,a]) s ← s' a ← a' until termination condition met end
内容的提问来源于stack exchange,提问作者Alexey Burnakov
相关产品推荐
相关产品推荐

