2D空间强化学习模型损失过高且无学习效果的问题咨询
问题描述
模型背景
参考某适用于网格空间蛇形游戏的强化学习教程视频,我改编了一套针对非网格2D空间的模型。
游戏环境
环境包含三个核心元素:
- 采用坦克式控制的可控小球
- 可被推动的目标小球
- 作为终点的方形目标方块
(注:游戏环境有对应示意图)
奖励机制
- 可控小球触碰目标小球时,给予正向奖励
- 每轮迭代结束时,目标小球与目标方块的距离越近,奖励值越高
当前问题
- 模型损失值波动极大,且数值异常偏高
(注:损失曲线包含当前值与平均值,有对应可视化图) - 模型完全无学习迹象
已尝试优化方案
- 对数据进行离散化处理
- 调整学习率参数
- 修改奖励机制(可能调整幅度不足)
怀疑方向
模型可能存在深层架构缺陷,或是原网格空间蛇形游戏的模型架构并不适配当前非网格的2D连续空间。
代码库地址:https://github.com/jamiemitch121/RLNN-2D
内容的提问来源于stack exchange,提问作者Jamie Mitchell
相关产品推荐
相关产品推荐

