You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Transformer嵌入存在各向异性,为何仍可用于RAG等场景的相似度计算?

Transformer嵌入各向异性与下游场景适配的疑问解析

为什么RAG等场景还能用余弦相似度计算相似度?

  • 余弦相似度只关注向量的方向差异,完全不关心向量在空间中的绝对位置。哪怕所有嵌入都挤在向量空间的一小块区域里,只要语义相关的向量方向更接近、无关的向量方向偏差大,余弦值的差异就足够支撑筛选逻辑。比如RAG里,查询和目标片段的嵌入角度差小,余弦值高,就能被判定为相关,和它们是不是挤在一起没关系。
  • 各向异性带来的是嵌入分布的“全局收缩”,但这种收缩不会打乱不同语义向量之间的相对方向关系。就像把所有向量往同一个方向压缩,它们彼此间的角度差依然保留,而余弦相似度恰恰只看这个角度差。

各向异性为何没影响嵌入的性能?

  • 预训练和下游微调的目标本来就不是让嵌入均匀分布。Transformer预训练(比如掩码语言模型任务)是要让语义相似的向量靠得更近,下游微调(比如RAG用的嵌入模型)更是强化了“语义关联→向量方向一致”的映射。只要这种相对关系是正确的,哪怕整体分布集中,也能满足任务需求。
  • 《各向异性》论文的研究指出:各向异性是Transformer训练过程中自然产生的现象——模型为了高效建模语义关联,会把高频通用的语义特征集中在空间核心区,低频特定语义放在边缘,但这种分布恰恰匹配多数下游任务的需求(比如RAG只需要区分相关和不相关,不需要向量铺满整个空间)。
  • 工程上的隐性优化:很多嵌入模型输出向量后会做单位归一化处理,把向量缩放到长度为1,这进一步放大了方向差异的权重,弱化了绝对距离的影响,让余弦相似度的区分效果更稳定。

内容的提问来源于stack exchange,提问作者yuu Mu

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.17 18:12:34