5×5迷宫MDP策略图绘制需求及相关参数说明
5×5迷宫MDP策略图绘制说明
我来帮你把这个迷宫的MDP策略相关内容整理成清晰的Markdown格式,包含状态矩阵、策略映射和可视化策略图:
1. 迷宫状态矩阵(5×5结构化展示)
原状态向量r = [1 0 1 1 1 1 1 1 0 1 0 1 0 0 1 1 1 1 0 1 1 0 1 0 1]对应5×5的迷宫矩阵如下(1为可行路径,0为墙体):
行1: [1, 0, 1, 1, 1] 行2: [1, 1, 1, 0, 1] 行3: [0, 1, 0, 0, 1] 行4: [1, 1, 1, 0, 1] 行5: [1, 0, 1, 0, 1]
2. 策略向量与动作映射规则
给定转置后的策略向量:policy_vector' = [3 2 2 2 3 2 2 1 2 3 1 1 1 2 3 2 1 4 2 3 1 1 1 2 2]
动作映射规则为:
1→ 向上(UP)2→ 向右(RIGHT)3→ 向下(DOWN)4→ 向左(LEFT)
注意:墙体状态(对应
r中0的位置)不会触发策略,因此策略图中忽略这些位置的策略。
3. 可视化MDP策略图
我们把每个可行位置的策略用方向符号标注,墙体用■表示,最终的迷宫策略图如下:
策略映射详情表
| 迷宫位置(行,列) | 状态值 | 对应策略动作 | 可视化符号 |
|---|---|---|---|
| (1,1) | 1 | 向下(3) | ↓ |
| (1,2) | 0 | - | ■ |
| (1,3) | 1 | 向右(2) | → |
| (1,4) | 1 | 向右(2) | → |
| (1,5) | 1 | 向下(3) | ↓ |
| (2,1) | 1 | 向右(2) | → |
| (2,2) | 1 | 向右(2) | → |
| (2,3) | 1 | 向上(1) | ↑ |
| (2,4) | 0 | - | ■ |
| (2,5) | 1 | 向下(3) | ↓ |
| (3,1) | 0 | - | ■ |
| (3,2) | 1 | 向上(1) | ↑ |
| (3,3) | 0 | - | ■ |
| (3,4) | 0 | - | ■ |
| (3,5) | 1 | 向下(3) | ↓ |
| (4,1) | 1 | 向右(2) | → |
| (4,2) | 1 | 向上(1) | ↑ |
| (4,3) | 1 | 向左(4) | ← |
| (4,4) | 0 | - | ■ |
| (4,5) | 1 | 向下(3) | ↓ |
| (5,1) | 1 | 向上(1) | ↑ |
| (5,2) | 0 | - | ■ |
| (5,3) | 1 | 向上(1) | ↑ |
| (5,4) | 0 | - | ■ |
| (5,5) | 1 | 向右(2) | → |
直观迷宫策略图
↓ ■ → → ↓ → → ↑ ■ ↓ ■ ↑ ■ ■ ↓ → ↑ ← ■ ↓ ↑ ■ ↑ ■ →
内容的提问来源于stack exchange,提问作者DeeeeRoy
相关产品推荐
相关产品推荐

