You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

VowpalWabbit上下文老虎机无视上下文生成单一PMF问题排查

上下文老虎机场景下VowpalWabbit PMF不随上下文变化的问题

问题现象

在上下文老虎机场景使用VowpalWabbit时,无论输入何种上下文,系统生成的动作选择PMF始终完全相同,不符合“不同上下文对应不同动作选择概率分布”的预期。

样本数据

shared |Context t1=a_c t2:5 t3=a_b t4:2 t5:10
|Action arm=a1 
|Action arm=a2 
|Action arm=a3 
|Action arm=a4 
0:-5:0.09 | Action arm=a5 
|Action arm=a6 
|Action arm=a7 
|Action arm=a8 
|Action arm=a9 
|Action arm=a10 
|Action arm=a11

初始化配置

--cb_explore_adf --cb_type mtr --epsilon 0.05

可能原因分析

训练数据层面

  • 反馈分布单一/样本量不足:如果训练数据仅包含少量样本,或所有样本中仅特定动作(如示例中的a5)有反馈,模型无法学习到上下文与动作选择的关联,最终收敛到固定PMF。
  • 动作特征缺失:示例中除a5外,其他动作仅包含arm标签特征,没有与上下文交互的专属特征,模型无法区分不同动作在不同上下文下的价值差异。

超参数与策略配置层面

  • --epsilon 0.05的影响:该参数启用epsilon-greedy策略,当模型尚未学到有效关联时,会以固定5%的概率随机探索,剩余95%选择当前最优动作;若最优动作未随上下文变化,PMF会保持一致。
  • --cb_type mtr的适配性:MTR(边际收益回归)需要足够多样的训练数据来拟合上下文-动作的价值函数,数据量不足或分布单一会导致模型无法收敛到差异化的PMF。

数据固有属性

若训练数据中动作分布本身与上下文无关,模型自然无法学到两者的关联,输出固定PMF是合理结果。


内容的提问来源于stack exchange,提问作者Abhishek_09

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.24 07:33:20