PPO与DQN训练中每回合平均奖励下降的原因排查
强化学习车间调度任务奖励下降问题排查请求
背景
- 基于SimRLFab代码仓库,将车间制造系统调度环境迁移至Gymnasium框架,Python版本从3.6升级至3.10
- 训练目标是让RL智能体最大化机器利用率,奖励函数定义为:
r_util = exp(util/1.5) - 1
问题现象
测试PPO、TRPO、DQN三种算法时,TensorBoard显示**每回合平均奖励(ep_re_mean)**随训练进程持续下降,与预期的上升趋势完全相反。目前怀疑模型可能误学会了最小化奖励,但无法确定具体原因。
已完成的排查动作
- 核对奖励函数逻辑,确认公式计算正确
- 验证TensorBoard中的奖励数值与日志记录的奖励完全一致
- 查阅相关技术帖子,未找到有效解决方案
提供的参考信息
- TensorBoard图表:
- 每回合平均奖励趋势图:整体呈持续下降走势
- 损失与策略梯度损失图:损失曲线波动明显
- 价值损失图:价值损失随训练逐步上升
- 环境核心代码:包含step函数、奖励计算函数、reset函数
- 完整代码可查看GitHub仓库JSP_Environment
内容的提问来源于stack exchange,提问作者WizardOfCLZ
相关产品推荐
相关产品推荐

