阅读LiLT论文疑问:语言建模场景下Transformer的permutation invariant指什么?
语言建模场景下Transformer的置换不变性(Permutation Invariant)含义解析
在语言建模的语境里,置换不变性说的是这么回事:如果把Transformer输入序列里的token顺序随便打乱重排,要是不考虑位置编码的影响,模型输出的token表征不会因为顺序变化而改变语义层面的对应关系。
具体拆解来看:
- Transformer的核心是多头注意力机制,它计算每个token和其他所有token的关联权重时,本质是看token之间的语义关联,而非它们在序列里的位置。没有位置编码的话,不管输入token的顺序怎么换,注意力的计算逻辑都是一样的。
- 举个例子:输入序列是["猫", "追", "老鼠"],要是把顺序换成["老鼠", "猫", "追"],没有位置编码的Transformer输出的三个token表征,会分别对应原序列里"老鼠""猫""追"的语义表征,只是顺序跟着输入变了——模型不会因为顺序打乱就搞混语义关联。
而LiLT论文里提到这个特性,其实是在强调:Transformer本身天生没法感知序列的顺序信息,必须靠额外的位置编码(比如绝对位置编码、相对位置编码),才能处理语言这种强依赖顺序的任务。
内容的提问来源于stack exchange,提问作者Aravind R
相关产品推荐
相关产品推荐

