You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

关于BERT中Token映射为Embedding的位置疑问:是否存在预编码器?

BERT中Token到Embedding的映射位置解析
  • Token到Embedding的映射是在Transformer Encoder之前完成的,存在独立的嵌入模块,并非Encoder内部的操作。
  • 具体流程:
    1. 先通过WordPiece分词得到Token序列(包含[CLS]、[SEP]等特殊Token);
    2. 送入独立的Token Embedding层,通过查表(预训练好的Embedding权重矩阵)将每个Token转换为对应的语义向量;
    3. 再叠加Position Embedding(位置信息向量)和Segment Embedding(分句标识向量),得到最终的输入Embedding;
    4. 最终的输入Embedding才会被送入Transformer Encoder,由Encoder内部的多层注意力机制、前馈网络完成语义的深度编码和更新。
  • 这个独立的嵌入层属于BERT模型的一部分,但和Transformer Encoder是前后模块的关系,映射操作完全在Encoder处理之前完成。预训练阶段,嵌入层会和Encoder一起被训练优化,微调时也会同步更新。

内容的提问来源于stack exchange,提问作者i82much

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.10 03:07:33