You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

5×5迷宫MDP策略图绘制需求及相关参数说明

5×5迷宫MDP策略图绘制说明

我来帮你把这个迷宫的MDP策略相关内容整理成清晰的Markdown格式,包含状态矩阵、策略映射和可视化策略图:

1. 迷宫状态矩阵(5×5结构化展示)

原状态向量r = [1 0 1 1 1 1 1 1 0 1 0 1 0 0 1 1 1 1 0 1 1 0 1 0 1]对应5×5的迷宫矩阵如下(1为可行路径,0为墙体):

行1: [1, 0, 1, 1, 1]
行2: [1, 1, 1, 0, 1]
行3: [0, 1, 0, 0, 1]
行4: [1, 1, 1, 0, 1]
行5: [1, 0, 1, 0, 1]

2. 策略向量与动作映射规则

给定转置后的策略向量:
policy_vector' = [3 2 2 2 3 2 2 1 2 3 1 1 1 2 3 2 1 4 2 3 1 1 1 2 2]
动作映射规则为:

  • 1 → 向上(UP)
  • 2 → 向右(RIGHT)
  • 3 → 向下(DOWN)
  • 4 → 向左(LEFT)

注意:墙体状态(对应r中0的位置)不会触发策略,因此策略图中忽略这些位置的策略。

3. 可视化MDP策略图

我们把每个可行位置的策略用方向符号标注,墙体用■表示,最终的迷宫策略图如下:

策略映射详情表

迷宫位置(行,列)状态值对应策略动作可视化符号
(1,1)1向下(3)↓
(1,2)0-■
(1,3)1向右(2)→
(1,4)1向右(2)→
(1,5)1向下(3)↓
(2,1)1向右(2)→
(2,2)1向右(2)→
(2,3)1向上(1)↑
(2,4)0-■
(2,5)1向下(3)↓
(3,1)0-■
(3,2)1向上(1)↑
(3,3)0-■
(3,4)0-■
(3,5)1向下(3)↓
(4,1)1向右(2)→
(4,2)1向上(1)↑
(4,3)1向左(4)←
(4,4)0-■
(4,5)1向下(3)↓
(5,1)1向上(1)↑
(5,2)0-■
(5,3)1向上(1)↑
(5,4)0-■
(5,5)1向右(2)→

直观迷宫策略图

↓  ■  →  →  ↓
→  →  ↑  ■  ↓
■  ↑  ■  ■  ↓
→  ↑  ←  ■  ↓
↑  ■  ↑  ■  →

内容的提问来源于stack exchange,提问作者DeeeeRoy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.25 06:23:57