关于BERT中Token映射为Embedding的位置疑问:是否存在预编码器?
BERT中Token到Embedding的映射位置解析
- Token到Embedding的映射是在Transformer Encoder之前完成的,存在独立的嵌入模块,并非Encoder内部的操作。
- 具体流程:
- 先通过WordPiece分词得到Token序列(包含[CLS]、[SEP]等特殊Token);
- 送入独立的Token Embedding层,通过查表(预训练好的Embedding权重矩阵)将每个Token转换为对应的语义向量;
- 再叠加Position Embedding(位置信息向量)和Segment Embedding(分句标识向量),得到最终的输入Embedding;
- 最终的输入Embedding才会被送入Transformer Encoder,由Encoder内部的多层注意力机制、前馈网络完成语义的深度编码和更新。
- 这个独立的嵌入层属于BERT模型的一部分,但和Transformer Encoder是前后模块的关系,映射操作完全在Encoder处理之前完成。预训练阶段,嵌入层会和Encoder一起被训练优化,微调时也会同步更新。
内容的提问来源于stack exchange,提问作者i82much
相关产品推荐
相关产品推荐

