Transformer注意力机制中WQ、WK、WV矩阵是否随输入词变化?
自注意力中WQ、WK、WV矩阵的一致性问题
在自注意力机制里,W_Q、W_K、W_V这三个矩阵是对所有输入词完全一致的,不会因为输入词的不同而变化。
它们属于自注意力层的全局可训练参数,在模型训练阶段整个层共享这一组参数。每个输入词的词嵌入,都会用相同的W_Q生成Query向量,用相同的W_K生成Key向量,用相同的W_V生成Value向量。这种设计的核心目的是让模型学习到一套通用的“关联规则”,能够对任意输入词之间的依赖关系进行统一建模,确保注意力计算的公平性和通用性。
内容的提问来源于stack exchange,提问作者Vinay Sharma
相关产品推荐
相关产品推荐

