You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

CTR预测中的位置偏差归一化:点击标签理想归一化方法问询

针对位置偏差的CTR标签归一化方法推荐

嘿,针对你用toy dataset做CTR预测时遇到的位置偏差问题——顶部内容点击率普遍更高,导致原始标签(#Click/#NumShown)不能真实反映内容本身的吸引力,我整理了几个业界常用且实用的归一化思路,你可以根据自己的数据集情况来选择:

  • 位置权重校准法
    这是最直接的思路:先统计每个展示位置的基准CTR,也就是该位置下所有内容的平均点击率(计算方式可以是(总点击数)/(总展示数))。然后把每个样本的原始CTR除以对应位置的基准CTR,得到归一化后的标签。
    举个例子:如果位置1的基准CTR是0.2,某个样本在位置1的原始CTR是0.3,归一化后就是0.3/0.2=1.5——这个数值代表该内容的表现比同位置平均水平高50%,完全剥离了位置本身的流量优势。
    小提醒:如果某个位置的展示量极少,基准CTR可能会波动很大,你可以给它加个平滑项,比如用(点击数 + α)/(展示数 + β)计算基准CTR,α和β可以设成全局平均点击、展示比例对应的数值,避免极端值干扰。

  • 逆倾向加权(IPW)
    把“内容被分配到某个位置”看作一个随机事件,我们需要修正这种分配带来的偏差。首先训练一个简单的分类模型,预测内容被分配到当前位置的概率(也就是倾向得分),然后用这个概率的倒数作为权重,对原始点击标签进行加权。
    比如:某内容被放在顶部的概率是0.8,那它的点击标签就乘以1/0.8=1.25——相当于“放大”了这个样本的权重,因为它本来就更容易被点击,我们通过加权来抵消这种先天优势,让模型聚焦于内容本身的吸引力。
    这种方法适合你的toy dataset有足够的内容-位置匹配数据,能训练出靠谱的倾向得分模型的情况。

  • 位置归一化的对数转换
    如果担心原始CTR的分布不均匀,你可以试试对数转换的方式:先对每个样本的CTR做log(CTR + ε)转换(加ε是为了避免CTR为0时log无意义,ε可以设成很小的数比如1e-6),然后减去对应位置的平均对数CTR。
    处理后,每个位置的标签都会围绕0波动,正值代表该内容比同位置平均表现好,负值则相反,同样能有效消除位置带来的偏差。

  • 多任务联合建模(无需提前归一化标签)
    不一定非要提前归一化标签,你可以把位置作为特征加入模型,同时训练两个任务:一个是原始CTR预测任务,另一个是位置偏好预测任务(预测内容会被分配到哪个位置)。模型会自动学习位置与CTR之间的关联,从而在最终预测时抵消位置偏差。
    这种方法适合你想保留原始标签信息,不想做预处理的场景,尤其适合toy dataset快速验证模型效果。

内容的提问来源于stack exchange,提问作者pseudo_teetotaler

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 04:21:13