You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

GPT-2论文中无监督目标全局最小值为何也是监督目标全局最小值

GPT-2论文中无监督/监督目标全局最小值一致性推导

首先明确论文中对应结论的原文表述:

由于监督目标与无监督目标完全一致,仅在序列的子集上进行评估,因此无监督目标的全局最小值同样是监督目标的全局最小值。

具体推理依据可以拆成3步理解:

  • 首先明确两个目标的计算逻辑完全同源
    GPT-2的无监督预训练目标本质是全序列逐位置next token预测损失:给模型输入一串连贯文本,对每个位置的token,要求模型根据它前面的所有token预测当前token,把所有位置的预测交叉熵加起来就是总损失,训练目标是让这个总损失尽可能小。
    论文里提到的适配下游任务的监督目标,没有新增任何任务专属的网络层,也没有修改损失计算规则,只是不再计算全序列所有位置的损失,只挑序列里属于任务输出部分的token子集算预测交叉熵:比如做问答任务时,问题部分的token不算损失,只有答案部分的token会被纳入损失计算。
  • 其次明确“仅在序列子集评估”的实际含义
    监督目标和无监督目标的唯一差异,就是损失求和的范围从「整个序列的所有位置」缩小成了「序列中特定的一部分位置」,单位置的损失计算规则、模型的推理逻辑没有任何区别。
  • 最后是全局最小值的传递逻辑
    如果一组模型参数是无监督目标的全局最小值,意味着这组参数在序列所有位置上的next token预测损失都达到了理论最低值(也就是预测完全准确,交叉熵为0)。这种情况下,从全序列里随便抽任意一个子集算损失和,结果必然也是理论最低值0——你所有题都拿满分了,那从卷子里抽任意一部分题算得分,肯定也是这部分题能拿到的最高分数,不可能存在另一组参数在这个子集上的损失比它更小。
    需要注意这个结论是单向的:监督目标的全局最小值不一定是无监督目标的全局最小值,毕竟只学好子集部分的内容,不代表全序列所有位置都能预测准。

内容的提问来源于stack exchange,提问作者Albin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.30 15:36:17