使用Cosine similarity损失时加权注意力对反向传播的影响差异
三元组持续学习模型加权操作性能增益问题
模型训练基本流程
- 训练阶段首先通过骨干网络提取三元组(anchor、positive、negative)的特征,随后对每个特征执行权重相乘操作
- 上述特征相乘所用权重由可训练模型 A 单独计算生成,模型 A 的输入为骨干网络提取到的三元组原始特征
- 基于加权后的三元组特征,分别计算anchor-positive、anchor-negative样本对的
cosine similarity(余弦相似度) - 计算得到的余弦相似度经可训练模型 B 转换为精细化相似度得分,最终基于这两个得分通过
triplet margin loss(三元组边界损失)完成模型优化
整个训练流程中仅模型 A 与模型 B 参与反向传播参数更新,其余包括骨干网络在内的模块均处于冻结状态。
问题背景与观测现象
余弦相似度的计算流程本身包含对每个输入特征的L2 normalization(L2归一化)操作,经实测确认,即便对特征乘以缩放权重,归一化后也会抵消权重带来的尺度影响——余弦相似度仅和两个向量的夹角相关,与向量本身的模长尺度无关。
基于该特性最初得到推论:受余弦相似度的尺度不变性影响,对特征乘以模型 A 生成权重的操作不会对学习过程产生任何作用。
但实验结果与该推论完全相反:
- 加入模型 A 计算权重并与特征相乘的训练流程,相比移除该操作的对照组,模型在评估集上的性能表现更优
- 进一步排查确认,是否加入模型 A 的权重相乘流程,会直接改变模型 B 的学习收敛程度
目前提出的待验证假设为:训练前向传播阶段,模型 A 输出权重与特征相乘的操作无实际作用,但反向传播阶段通过链式法则(chain rule)会引入额外梯度项,能够更精准地指引模型 B 的参数更新方向。
恳请相关领域研究者解答该性能提升的真实底层原因。
内容的提问来源于stack exchange,提问作者Jo-won
相关产品推荐
相关产品推荐

