为何正弦模型在Transformer架构中被归为绝对位置编码?
正弦位置编码被归为绝对位置编码的原因
定义层面的本质区分
绝对位置编码的核心特征是为序列中每个位置分配固定且独立的嵌入向量,向量值仅由位置本身决定,与其他位置无关。正弦位置编码完全符合这一定义:每个位置t对应唯一的P_t,无论上下文如何变化,该位置的嵌入向量都是固定不变的。而相对位置编码的设计逻辑是直接建模词与词之间的相对距离/顺序关系,而非给单个位置打独立的绝对标签。理论特性与实际模型的脱节
你提到的“正弦嵌入点积仅依赖相对距离”是纯位置嵌入的数学特性,但在Transformer的注意力计算流程中,位置嵌入会和词嵌入一起经过W_q、W_k等投影矩阵处理。正如相关研究指出:两个正弦位置嵌入的点积仅取决于它们的相对距离,即
P_t^T·P_{t+r}与t无关;且P_t^T·P_{t+r}=P_t^T·P_{t-r},意味着正弦位置嵌入无法感知方向。但实际应用中,正弦嵌入会通过两个不同的投影矩阵进行投影,这会破坏这些特性。
一旦经过投影操作,原本能间接反映相对关系的点积特性就完全消失了。此时正弦编码在实际模型中仅起到“标记每个位置绝对身份”的作用,这也是多数文献将其归为绝对位置编码的核心原因。原始论文表述的语境局限
Vaswani等人在原始论文中提到正弦模型能捕捉相对关系,是基于纯位置嵌入的数学推导,但这一特性并未在Transformer的实际注意力计算中保留——注意力层计算的是(词嵌入+位置嵌入)经过投影后的查询、键向量的点积,而非纯位置嵌入的点积,投影操作直接消解了原本的相对特性。
内容的提问来源于stack exchange,提问作者Ali Haider Ahmad
相关产品推荐
相关产品推荐

