You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Cosine similarity损失时加权注意力对反向传播的影响差异

三元组持续学习模型加权操作性能增益问题

模型训练基本流程

  • 训练阶段首先通过骨干网络提取三元组(anchor、positive、negative)的特征,随后对每个特征执行权重相乘操作
  • 上述特征相乘所用权重由可训练模型 A 单独计算生成,模型 A 的输入为骨干网络提取到的三元组原始特征
  • 基于加权后的三元组特征,分别计算anchor-positive、anchor-negative样本对的cosine similarity(余弦相似度)
  • 计算得到的余弦相似度经可训练模型 B 转换为精细化相似度得分,最终基于这两个得分通过triplet margin loss(三元组边界损失)完成模型优化

整个训练流程中仅模型 A 与模型 B 参与反向传播参数更新,其余包括骨干网络在内的模块均处于冻结状态。

问题背景与观测现象

余弦相似度的计算流程本身包含对每个输入特征的L2 normalization(L2归一化)操作,经实测确认,即便对特征乘以缩放权重,归一化后也会抵消权重带来的尺度影响——余弦相似度仅和两个向量的夹角相关,与向量本身的模长尺度无关。
基于该特性最初得到推论:受余弦相似度的尺度不变性影响,对特征乘以模型 A 生成权重的操作不会对学习过程产生任何作用。
但实验结果与该推论完全相反:

  • 加入模型 A 计算权重并与特征相乘的训练流程,相比移除该操作的对照组,模型在评估集上的性能表现更优
  • 进一步排查确认,是否加入模型 A 的权重相乘流程,会直接改变模型 B 的学习收敛程度

目前提出的待验证假设为:训练前向传播阶段,模型 A 输出权重与特征相乘的操作无实际作用,但反向传播阶段通过链式法则(chain rule)会引入额外梯度项,能够更精准地指引模型 B 的参数更新方向。
恳请相关领域研究者解答该性能提升的真实底层原因。

内容的提问来源于stack exchange,提问作者Jo-won

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.28 05:24:15