You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

RLLIB PPO算法连续动作空间下策略神经网络的输出结构是怎样的

RLLIB PPO连续动作空间策略网络输出排布说明

核心结论

针对你提到的2动作维度场景,RLLIB的排布规则为第二种:mean_0 - mean_1 - std_dev_0 - std_dev_1,即所有动作维度的均值在前,所有动作维度的标准差在后。

详细规则说明

  • 对于N维连续动作空间,策略网络的输出头长度固定为2*N,前N个位置依次输出每个动作维度的均值,后N个位置依次输出每个动作维度的对数标准差(默认输出的是对数标准差,后续会经过exp运算得到实际使用的标准差)
  • 所有输出对角高斯分布的连续动作算法(包括但不限于PPO、SAC、DDPG)在RLLIB中都遵循该排布规则,不局限于PPO算法。

验证逻辑

你可以从RLLIB的对角高斯分布实现代码中直接看到对应逻辑,核心处理代码大致如下:

# 将模型输出的最后一维切分为长度相等的前后两段
action_mean, action_log_std = torch.chunk(model_output, 2, dim=-1)
# 对对数标准差做指数运算得到实际标准差
action_std = torch.exp(action_log_std)

常见注意点

  • 默认配置下标准差是独立于观测输入的全局可学习参数,不会随状态变化;如果需要让标准差也随观测输入动态调整,需要修改策略头配置,将标准差计算也纳入网络前向传播链路。
  • 采样动作时会基于上述切分得到的均值和标准差构造对角高斯分布,维度不会出现错位。

内容的提问来源于stack exchange,提问作者Wadhah

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.01 15:39:03