You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

2D空间强化学习模型损失过高且无学习效果的问题咨询

问题描述

模型背景

参考某适用于网格空间蛇形游戏的强化学习教程视频,我改编了一套针对非网格2D空间的模型。

游戏环境

环境包含三个核心元素:

  • 采用坦克式控制的可控小球
  • 可被推动的目标小球
  • 作为终点的方形目标方块
    (注:游戏环境有对应示意图)

奖励机制

  • 可控小球触碰目标小球时,给予正向奖励
  • 每轮迭代结束时,目标小球与目标方块的距离越近,奖励值越高

当前问题

  • 模型损失值波动极大,且数值异常偏高
    (注:损失曲线包含当前值与平均值,有对应可视化图)
  • 模型完全无学习迹象

已尝试优化方案

  • 对数据进行离散化处理
  • 调整学习率参数
  • 修改奖励机制(可能调整幅度不足)

怀疑方向

模型可能存在深层架构缺陷,或是原网格空间蛇形游戏的模型架构并不适配当前非网格的2D连续空间。

代码库地址:https://github.com/jamiemitch121/RLNN-2D

内容的提问来源于stack exchange,提问作者Jamie Mitchell

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.25 07:31:17