You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

未知范围下的RL奖励函数构建:无界数学函数最小化难题

未知范围函数的RL奖励设计方案

针对函数极值范围完全未知的情况,以下几种实用方法可以设计出归一化到[-1,1]的奖励,核心是聚焦相对改进而非绝对数值:

  • 滑动窗口相对改进法
    维护一个最近N步(比如100步)的函数值观测窗口,基于窗口内的局部范围计算奖励:

    eps = 1e-8
    # 更新窗口,保留最近N个值
    window_values.append(current_val)
    window_values = window_values[-N:]
    # 计算窗口内的极值
    best_window = min(window_values)  # 因为是最小化任务
    max_window = max(window_values)
    min_window = min(window_values)
    # 计算奖励并裁剪到[-1,1]
    improvement = (best_window - current_val) / (max_window - min_window + eps)
    reward = max(min(improvement, 1.0), -1.0)
    

    优势:仅依赖近期探索的局部信息,能快速响应当前改进趋势,不受全局极端值干扰。

  • 累计最优指数缩放法
    维护全局历史最优值best_so_far,用tanh函数将改进量映射到[-1,1]:

    k = 0.1  # 可调缩放系数,根据探索步长调整
    # 更新全局最优
    if current_val < best_so_far:
        best_so_far = current_val
    # 计算奖励
    improvement = best_so_far - current_val
    reward = math.tanh(k * improvement)
    

    优势:直接聚焦于“比历史最优的改进幅度”,天然适配任意范围的函数值,不会因全局范围发散导致奖励失效。

  • 自适应范围更新法
    实时维护全局观测到的global_min和global_max,基于动态更新的全局范围计算奖励:

    eps = 1e-8
    # 更新全局极值
    global_min = min(global_min, current_val)
    global_max = max(global_max, current_val)
    # 防止范围过大导致奖励趋近于0,设置阈值
    range_threshold = 1e6
    current_range = global_max - global_min
    if current_range > range_threshold:
        current_range = range_threshold
    # 计算奖励
    improvement = (best_so_far - current_val) / (current_range + eps)
    reward = max(min(improvement, 1.0), -1.0)
    

    优势:兼顾全局探索和局部改进,通过阈值限制避免极端范围的干扰。

  • 步长导向改进法
    完全不依赖绝对值,只关注每一步的相对变化方向和幅度:

    k = 0.05
    if current_val < last_val:
        # 找到更优值,奖励正分
        reward = math.tanh(k * abs(last_val - current_val))
    else:
        # 结果变差,奖励负分
        reward = -math.tanh(k * abs(last_val - current_val))
    

    优势:无需任何范围信息,适合快速迭代的探索场景,但需注意长期可能陷入局部最优。

额外注意事项

  • eps建议设为1e-8级别,避免出现除以0的异常。
  • 缩放系数k可根据初始探索的步长动态调整:若初始步长变化大,调小k;若步长变化小,调大k。
  • 可组合多种方法:比如前期用滑动窗口快速适应局部环境,后期切换到累计最优的指数缩放,兼顾短期反馈和长期目标。

内容的提问来源于stack exchange,提问作者Daniel von Eschwege

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.25 20:15:37