You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于Q-Learning的中继选择任务:奖励函数设定疑问

Q-learning中继选择任务的奖励函数设计方案

基础核心型奖励(优先满足任务目标)

直接围绕信号传输是否成功设定奖励,逻辑简单易实现:

  • 当选中的中继成功完成信号传输(比如接收端检测到的功率/信噪比达到预设阈值),给予正奖励,比如 +15;
  • 若传输失败,给予负奖励,比如 -10,让模型快速规避无效选择。

结合功率特性的优化型奖励

如果希望模型同时兼顾“传输成功率”和“中继功率优势”,可以在基础奖励上叠加功率相关的加权项:

  • 成功传输时,奖励 = 基础正奖励 + (Pi / 当前状态最大功率) * 5,其中Pi是选中中继的功率值。这样功率越高的成功中继,获得的奖励越多,强化模型优先选高功率且可靠的中继;
  • 传输失败时,奖励 = 基础负奖励 - (Pi / 当前状态最大功率) * 3,意思是选了高功率却失败的中继,惩罚更重,督促模型排查这类异常情况。

避免无效尝试的惩罚型奖励

如果存在部分中继频繁失败,可以加入累计惩罚机制:

  • 记录每个中继的连续失败次数,当选中该中继再次失败时,额外扣除 连续失败次数 * 2 的奖励;
  • 若该中继成功传输,则重置其连续失败次数,同时给予额外的+5奖励,鼓励模型重新尝试这类“改过自新”的中继。

MATLAB中快速实现示例

比如用简单的基础奖励逻辑,代码片段可以这么写:

function reward = calculateReward(selectedRelay, receivedPower, threshold)
    if receivedPower >= threshold
        reward = 15; % 传输成功的正奖励
    else
        reward = -10; % 传输失败的负奖励
    end
end

内容的提问来源于stack exchange,提问作者chaaru

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 18:25:26