You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

StableBaselines3/PPO模型仅采样无学习:最小学习步数咨询

强化学习PPO模型学习阶段未触发问题及疑问

现象说明

模型学习过程包含两个阶段:

  1. 采样阶段(rollout phase)
  2. 学习阶段(learning phase)

我的模型仅执行采样阶段,从未进入学习阶段,该现象在VSCode的Jupyter Notebook文本输出及TensorBoard中均有体现。

环境测试发现

我搭建了一个非常简单的强化学习环境(environment)并尝试了更多步数,发现:

若步数过少,模型不会显示学习迹象

疑问

  • 模型实现学习所需的最小步数是多少?
  • 该最小步数是否适用于所有环境,还是取决于具体环境?

测试代码

import time

tic = time.perf_counter()

log_path = os.path.join('Training', 'Logs')
model = PPO("MlpPolicy", env, verbose=1, tensorboard_log=log_path)
modelRtn = model.learn(total_timesteps=1000, progress_bar=True)

toc = time.perf_counter()
print("Elapsed time:  " + str(toc-tic) + " sec")

内容的提问来源于stack exchange,提问作者user3533030

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.31 13:10:46