BERT编码器块注意力层后Token Embeddings的归一化方式问询
BERT多头注意力后层归一化的计算方式
- 结论:BERT编码器块中,多头注意力层之后的层归一化(Layer Normalization)是对每个Token的Embedding单独进行——即每个Token的Embedding向量会使用自身的均值和方差做归一化。
- 具体逻辑:层归一化的计算维度是特征维度(比如BERT-base的768维Embedding维度),而非Token序列维度。假设输入是形状为
[batch_size, seq_len, hidden_size]的张量,层归一化会在hidden_size这个维度上,为每个[batch_size, seq_len]位置的Token单独计算均值和方差,再执行归一化操作。 - 与批归一化的差异:这和批归一化在batch维度统计全局均值方差的逻辑完全不同,层归一化的统计量仅基于单个Token的Embedding特征维度,因此每个Token的归一化过程都是独立的。
内容的提问来源于stack exchange,提问作者Fijoy Vadakkumpadan
相关产品推荐
相关产品推荐

