You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PPO与DQN训练中每回合平均奖励下降的原因排查

强化学习车间调度任务奖励下降问题排查请求

背景

  • 基于SimRLFab代码仓库,将车间制造系统调度环境迁移至Gymnasium框架,Python版本从3.6升级至3.10
  • 训练目标是让RL智能体最大化机器利用率,奖励函数定义为:r_util = exp(util/1.5) - 1

问题现象

测试PPO、TRPO、DQN三种算法时,TensorBoard显示**每回合平均奖励(ep_re_mean)**随训练进程持续下降,与预期的上升趋势完全相反。目前怀疑模型可能误学会了最小化奖励,但无法确定具体原因。

已完成的排查动作

  • 核对奖励函数逻辑,确认公式计算正确
  • 验证TensorBoard中的奖励数值与日志记录的奖励完全一致
  • 查阅相关技术帖子,未找到有效解决方案

提供的参考信息

  • TensorBoard图表:
    • 每回合平均奖励趋势图:整体呈持续下降走势
    • 损失与策略梯度损失图:损失曲线波动明显
    • 价值损失图:价值损失随训练逐步上升
  • 环境核心代码:包含step函数、奖励计算函数、reset函数
  • 完整代码可查看GitHub仓库JSP_Environment

内容的提问来源于stack exchange,提问作者WizardOfCLZ

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.28 21:52:38