关于MENACE井字棋匹配盒电脑的训练与最优玩法问询
关于MENACE训练与最优玩法的问题解答
首先,能靠10000局训练在随机对战里取得这么高的胜率已经很厉害了,刚编码几个月就能完成复刻,这点值得肯定!
针对你的三个问题,解答如下:
完全复刻的实体MENACE达到最优玩法所需的训练局数
井字棋的状态空间(考虑对称性后)其实很小,原版MENACE通常只需要几百到一千局左右的训练就能收敛到最优玩法。如果是和水平相当的对手(比如另一个MENACE或者会玩的人类)对战,大概200-300局就能学会避免致命错误,再经过几百局巩固就能稳定达到最优状态——也就是不会输,要么赢要么逼平对手。原版实体MENACE是否达到过最优玩法
是的,Donald Michie本人的原版实体MENACE经过训练后确实达到了井字棋的最优玩法。通过“赢棋加火柴、输棋减火柴、平局不调整”的奖惩机制,MENACE会逐步淘汰导致失败的走法,保留能赢或平局的策略,最终收敛到不会犯错的状态。仅对抗随机走法训练能否达到最优玩法
理论上可行,但需要极多的训练局数,效率极低。因为随机走法会频繁出现低级错误,MENACE即使走了非最优的棋也可能赢下对局,这会让它保留那些实际上不好的走法(对应的火柴不会被移除)。只有当随机走法碰巧走出能击败非最优走法的步骤时,MENACE才会得到负面反馈,但这种情况出现的概率很低。要靠随机对战让MENACE收敛到最优,可能需要数万甚至数十万局的训练,远不如和高手或另一个MENACE对战的训练效率高。
注:你的实现仓库我注意到了,虽然你说代码不够规范,但作为入门练习已经很扎实了。
内容的提问来源于stack exchange,提问作者ACertainArchangel
相关产品推荐
相关产品推荐

