Azure Personalizer中匹配奖励与观测奖励的差异及相关疑问
Azure Personalizer 匹配奖励与观测奖励详解
概念明确
- 观测奖励(Observed Rewards):所有Rank调用(不管是探索还是利用模式)对应的奖励总和,只要你通过Reward API上报了奖励,都会被统计到这里,和你本地记录的学习事件一致是正常情况。
- 匹配奖励(Matched Rewards):和你猜想的不一样,它不是仅统计利用阶段的奖励。准确来说,只有当模型在Rank调用中返回的Top1推荐动作,恰好是用户实际选择并触发奖励的动作时,这个奖励才会被计入匹配奖励。简单讲,就是模型推的首选内容被用户接受并产生奖励,才算匹配奖励。
匹配事件数量极低的常见原因
结合你提到的匹配奖励远低于观测奖励的情况,可能的原因有这几点:
- 探索模式的影响:20%的探索调用中,模型会故意推荐非最优动作来收集数据,如果用户恰好选中了这些探索推荐的动作并产生奖励,这类奖励会被计入观测奖励,但因为模型推荐的Top1不是这个动作,所以不会算进匹配奖励。
- 模型推荐准确率不足:在80%的利用调用里,模型推荐的Top1动作和用户实际选择的不匹配,导致很多上报的奖励无法被归类为匹配奖励。
- 奖励上报逻辑偏差:如果你的Reward API是针对用户选择的动作上报奖励,而不是针对模型推荐的Top1动作,那么当用户选了非Top1的选项时,即便有奖励,也不会触发匹配奖励的统计。
内容的提问来源于stack exchange,提问作者Ross Perry
相关产品推荐
相关产品推荐

