MarianMT模型如何预测目标句首个词?Transformer机器翻译问询
MarianMT与T5预测目标句首个词的机制
你提到的这两个模型并非没有起始触发逻辑,只是和常见的<cls>/<s>显式句首标记不一样:
MarianMT的实现方式
MarianMT直接复用**目标语言的句末标记</s>**作为生成首个目标词的起始信号:
- 训练时,目标序列的头部会自动拼接
</s>,模型结合源句的编码信息与这个标记,预测第一个真实目标词; - 推理生成目标句时,初始输入就是
</s>,模型基于源句的编码结果,直接输出第一个目标词。
T5的实现方式
T5是统一的文本到文本框架,它没有单独的句首标记,但通过任务前缀+源句的输入设计,让模型直接学习预测目标句的第一个词:
- 训练阶段,目标序列是完整的目标句,模型以带任务前缀的源句(比如
translate English to French: 原句内容)为输入,直接预测目标句的首个词; - 推理阶段,初始输入为空序列,模型基于源句的编码信息直接生成第一个词,后续把已生成的词拼接到输入中继续预测,直到输出
</s>结束标记。
说白了,这俩模型要么复用已有标记当起始信号,要么靠框架设计省去了显式句首标记,核心的起始触发逻辑一直存在,能正常预测目标句的第一个词。
内容的提问来源于stack exchange,提问作者duynguyen236
相关产品推荐
相关产品推荐

