You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Transformer架构中,负责下一词映射的核心组件是哪个?

Transformer机器翻译下一词生成的核心组件解析

在你描述的推理场景(输入目标序列[<BOS>, 'I', 'am']生成后续词fine)中,**带掩码的因果自注意力(Masked Causal Self-Attention)+ 最终输出层(全连接+Softmax)**是完成下一词映射的核心,Cross-Attention和前馈网络(Feed-Forward)则负责提供关键的上下文支撑。以下是各组件的具体作用:

1. 核心:带掩码的因果自注意力 + 输出层

  • 带掩码的因果自注意力的核心是建模目标序列内部的上下文依赖:它会将am的嵌入与之前的<BOS>、I的嵌入做注意力计算,生成融合了目标端上下文的新嵌入——这个嵌入已经编码了目标语言的内在逻辑(比如“I am之后的常用搭配”“英语语法的主谓一致规则”)。
  • 最终的下一词映射由输出层完成:经过注意力和前馈网络处理后的上下文嵌入,会被输入到一个全连接层,将嵌入维度映射到整个目标词表的维度,再通过Softmax计算每个词的概率,概率最高的fine就是最终输出。

2. Cross-Attention:提供源语言语义约束

Cross-Attention的作用是把源语言(西班牙语yo estoy bien)的语义信息注入到目标端的上下文嵌入中,确保生成的词符合源语的语义(比如不会把bien错误翻译成bad)。它不会直接生成下一词,但会修正目标端上下文嵌入的语义方向,让输出层能选出匹配源语意思的正确词汇。

3. Feed-Forward Layers:精细化上下文嵌入

前馈网络是对每个位置的嵌入做独立的非线性变换,它会把注意力输出的上下文嵌入做进一步的特征提取和强化,让嵌入更精准地编码当前位置的语义信息,为输出层的概率计算提供更优质的输入。

纠正一个误解

你提到的“Cross-Attention中'am'应与最可能的下一词'bien'相似度高”并不准确:Cross-Attention是目标端的每个词(I、am)去关注源端的所有词(yo、estoy、bien),比如am会重点关联estoy,后续生成的fine会重点关联bien——它的作用是建立“目标词-源词”的语义对应,而非直接映射下一词。

内容的提问来源于stack exchange,提问作者Fernando Wittmann

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.07 00:22:57