You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

自定义RL环境预测时grid与PV值为空列表问题排查

电网优化RL模型预测时grid_values/pv_values为空的排查与修复

问题背景

开发电网优化模型,基于自定义强化学习环境训练A2C模型,训练阶段可正常提取grid_values和pv_values有效数据;但在独立Jupyter Notebook加载训练完成的模型、使用新数据集预测时,这两个列表始终为空。

核心原因分析

1. model.predict()返回值未正确处理

Stable Baselines3中A2C.predict()方法返回的是元组:(action, state)(非递归策略下state为None)。但预测代码中直接将整个元组传入env.step(action),导致环境的step()方法无法匹配到action == 0或action == 1的分支,直接进入else逻辑(返回惩罚reward),完全没有执行grid_values或pv_values的追加操作。

2. 环境reset()未重置数据存储列表

当前CostEnv.reset()方法仅重置了episode_length和done状态,但未清空pv_values和grid_values。虽然这不是本次为空的直接原因,但会导致多轮episode运行时数据累积,影响后续结果准确性。

3. 观测空间定义存在错误

环境的observation_space中,Box的dtype设为int,但实际传入的load和pv是浮点数值(如0.4014),数据会被截断;同时high值设为episode_length - 1(时间步数量),与实际负载/光伏数值范围无关,会导致模型输入处理异常,间接影响动作选择。

修复方案

1. 修正预测代码的动作获取逻辑

将预测代码中的动作获取部分修改为:

episodes = 20

for ep in range(episodes):
    obs = env.reset()
    done = False
    while not done:
        # 提取predict返回的第一个元素(实际动作)
        action, _ = model.predict(obs)
        obs, rewards, done, info = env.step(action)

env.close()

或直接取索引0:

action = model.predict(obs)[0]

2. 完善环境reset()方法

在reset()中添加数据列表的重置逻辑,确保每轮episode开始时列表为空:

def reset(self):
    self.done = False
    # 重置存储列表
    self.pv_values = []
    self.grid_values = []
    # 重置 episode 长度
    self.episode_length = len(self.load)
    
    observation = {
        "load": (0, self.load[len(self.load)-self.episode_length]),
        "pv": (0, self.pv[len(self.pv)-self.episode_length]),
        }
    
    return observation

3. 修正观测空间定义

根据实际数据类型和范围调整observation_space:

import numpy as np

self.observation_space = Dict(
    {
        "load": Box(low=0, high=self.load.max(), shape=(2,), dtype=np.float32),
        "pv": Box(low=0, high=self.pv.max(), shape=(2,), dtype=np.float32),
    }
)

用数据的实际最大值作为Box的上限,同时将dtype改为浮点类型,匹配输入数据格式。

验证步骤

  1. 运行修正后的预测代码,打印action值,确认其为0或1的整数。
  2. 单轮episode运行结束后,检查env.grid_values或env.pv_values是否有数据生成。
  3. 多轮episode运行后,确认每次reset()后列表会被清空,无跨轮数据残留。

内容的提问来源于stack exchange,提问作者Sam

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.31 06:24:35