You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于Q-learning的atcenv模拟器状态与动作空间定义问询

适配随机扇区ATC模拟器的Q-learning状态与动作空间定义方案

状态空间定义

针对随机生成的扇区,不能依赖固定网格索引,需提取与避撞强相关的核心特征,并根据Q-learning的需求做离散化或适配:

  • 核心特征维度:

    • 自机状态:x/y坐标(相对于扇区的归一化值)、航向角、速度
    • 威胁目标状态:取N个最近飞行器的相对位置偏移、相对速度、航向差;若少于N个则补0值
    • 扇区约束:自机到扇区各边界的剩余距离
    • 风险指标:可选预计算的碰撞风险等级(安全/预警/危险)
  • 离散化处理(适配传统Q-learning):

    • 把每个连续特征划分为有限区间,例如:
      • 归一化坐标:分成[-1,-0.5), [-0.5,0), [0,0.5), [0.5,1] 4档
      • 航向角:按30°间隔分成12档
      • 相对距离:分成>5km(安全)、2-5km(预警)、<2km(危险)3档
    • 所有离散特征的组合即为最终离散状态空间
  • 连续状态适配(DQN方案):
    若离散化损失过多信息,直接将上述连续特征作为输入,用深度Q网络做函数近似,无需手动离散化,更适配随机扇区的动态性

动作空间定义

结合ATC避撞的实际操作,定义离散化的动作集,同时适配随机扇区的边界约束:

  • 基础动作集:

    • 无动作:保持当前航向、速度
    • 航向调整:左偏10°、右偏10°、左偏20°、右偏20°(可根据模拟器精度调整幅度)
    • 速度调整:加速5节、减速5节、加速10节、减速10节
    • (若支持三维)高度调整:上升1000ft、下降1000ft
  • 扇区约束适配:
    在动作选择前增加过滤逻辑:若自机靠近扇区边界(距离<阈值),则禁止朝向边界的航向调整动作,避免飞出扇区

额外适配技巧

  • 扇区归一化:将所有位置类特征转换为相对于扇区中心的归一化值(范围[-1,1]),确保无论扇区大小、位置如何随机,状态特征的尺度统一,降低模型或Q-table的适配成本
  • 动态威胁过滤:仅保留自机周围一定范围内(如5km)的飞行器作为威胁目标,减少状态维度,聚焦关键避撞信息

内容的提问来源于stack exchange,提问作者itsChibi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 05:05:23