StableBaselines3/PPO模型仅采样无学习:最小学习步数咨询
强化学习PPO模型学习阶段未触发问题及疑问
现象说明
模型学习过程包含两个阶段:
- 采样阶段(rollout phase)
- 学习阶段(learning phase)
我的模型仅执行采样阶段,从未进入学习阶段,该现象在VSCode的Jupyter Notebook文本输出及TensorBoard中均有体现。
环境测试发现
我搭建了一个非常简单的强化学习环境(environment)并尝试了更多步数,发现:
若步数过少,模型不会显示学习迹象
疑问
- 模型实现学习所需的最小步数是多少?
- 该最小步数是否适用于所有环境,还是取决于具体环境?
测试代码
import time tic = time.perf_counter() log_path = os.path.join('Training', 'Logs') model = PPO("MlpPolicy", env, verbose=1, tensorboard_log=log_path) modelRtn = model.learn(total_timesteps=1000, progress_bar=True) toc = time.perf_counter() print("Elapsed time: " + str(toc-tic) + " sec")
内容的提问来源于stack exchange,提问作者user3533030
相关产品推荐
相关产品推荐

