基于Ray RLlib在自定义Gym环境部署PPO智能体遇阻求助
强化学习框架适配与环境相关问题
背景与核心问题
- 长期关注强化学习领域,曾基于Stable Baselines3、PyTorch和Gym实现了对接Binance数据的比特币交易PPO智能体,搭建及运行流程顺畅,模型效果符合预期;但发现Stable Baselines3训练效率较低,GPU训练500轮耗时约3周。
- 为提升训练效率,尝试将自定义Gym交易环境适配到Ray/RLlib框架,但多次查阅官方文档、观看教程,甚至借助GPT-4协助都未能解决问题,始终无法正常运行。困惑于为何在Stable Baselines3中可轻松实现的功能,在Ray/RLlib中适配难度极大,且未找到清晰易懂的相关适配指引。
- 已附上自定义交易环境代码,恳请帮忙排查问题,或推荐优质的最新教程。
额外疑问
- 听闻Gymnasium相比Gym更优,该说法是否属实?
内容的提问来源于stack exchange,提问作者Max van kekeren
相关产品推荐
相关产品推荐

