You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

BERT编码器块注意力层后Token Embeddings的归一化方式问询

BERT多头注意力后层归一化的计算方式
  • 结论:BERT编码器块中,多头注意力层之后的层归一化(Layer Normalization)是对每个Token的Embedding单独进行——即每个Token的Embedding向量会使用自身的均值和方差做归一化。
  • 具体逻辑:层归一化的计算维度是特征维度(比如BERT-base的768维Embedding维度),而非Token序列维度。假设输入是形状为[batch_size, seq_len, hidden_size]的张量,层归一化会在hidden_size这个维度上,为每个[batch_size, seq_len]位置的Token单独计算均值和方差,再执行归一化操作。
  • 与批归一化的差异:这和批归一化在batch维度统计全局均值方差的逻辑完全不同,层归一化的统计量仅基于单个Token的Embedding特征维度,因此每个Token的归一化过程都是独立的。

内容的提问来源于stack exchange,提问作者Fijoy Vadakkumpadan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.16 09:03:11