You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure Personalizer中匹配奖励与观测奖励的差异及相关疑问

Azure Personalizer 匹配奖励与观测奖励详解

概念明确

  • 观测奖励(Observed Rewards):所有Rank调用(不管是探索还是利用模式)对应的奖励总和,只要你通过Reward API上报了奖励,都会被统计到这里,和你本地记录的学习事件一致是正常情况。
  • 匹配奖励(Matched Rewards):和你猜想的不一样,它不是仅统计利用阶段的奖励。准确来说,只有当模型在Rank调用中返回的Top1推荐动作,恰好是用户实际选择并触发奖励的动作时,这个奖励才会被计入匹配奖励。简单讲,就是模型推的首选内容被用户接受并产生奖励,才算匹配奖励。

匹配事件数量极低的常见原因

结合你提到的匹配奖励远低于观测奖励的情况,可能的原因有这几点:

  1. 探索模式的影响:20%的探索调用中,模型会故意推荐非最优动作来收集数据,如果用户恰好选中了这些探索推荐的动作并产生奖励,这类奖励会被计入观测奖励,但因为模型推荐的Top1不是这个动作,所以不会算进匹配奖励。
  2. 模型推荐准确率不足:在80%的利用调用里,模型推荐的Top1动作和用户实际选择的不匹配,导致很多上报的奖励无法被归类为匹配奖励。
  3. 奖励上报逻辑偏差:如果你的Reward API是针对用户选择的动作上报奖励,而不是针对模型推荐的Top1动作,那么当用户选了非Top1的选项时,即便有奖励,也不会触发匹配奖励的统计。

内容的提问来源于stack exchange,提问作者Ross Perry

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.20 01:25:21