You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Transformer架构中第一个解码器的输入是什么?

Transformer解码器的输入逻辑

针对你用"The cat jumped."举例的场景,分两部分明确解码器的输入逻辑:

1. 编码器传递给解码器的输入

最后一层编码器输出的三个token向量(对应每个输入单词),会以序列张量的形式整体并行传入解码器——这个张量会被解码器每一层的「编码器-解码器注意力层」当作Key和Value使用,让解码器能关注到输入序列的所有信息。它的尺寸固定为[输入序列长度, 隐藏维度],和解码器自身的输入维度匹配,不需要拼接或合并操作。

2. 解码器自身的输入

  • 训练阶段:解码器的输入是完整的目标序列(比如翻译任务里的目标句子),同样先做embedding+位置编码,然后整体并行输入到第一层解码器。同时会用「掩码(Mask)」挡住当前token之后的内容,避免模型提前看到未来信息。
  • 推理阶段:解码器是逐token输入的。一开始输入特殊的(序列开始)token,生成第一个输出token后,把这个token和拼接起来作为下一次输入,重复该过程直到生成(序列结束)token。

内容的提问来源于stack exchange,提问作者eddys

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.24 18:52:09