You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

向GPT3输入提示词时,输入数据会经过哪些处理流程?

GPT-3 处理输入提示的全流程运算逻辑

输入预处理阶段

你在Playground敲入Quack这5个字符点下生成之后,数据不会直接进模型核心,先走两步基础转换:

  • 首先做BPE(字节对编码)分词,Quack刚好命中GPT-3词表里的独立token,不会拆成单字符,会被直接映射成词表对应的整数ID,同时叠加位置编码,标记这个token处于整个输入序列的第0位,是所有后续计算的起点。
  • 预处理完的张量会送进堆叠的Transformer解码器层(1750亿参数的Davinci版本共96层),每一层都做两类固定运算:第一类是带因果掩码的自注意力计算——因果掩码会硬限制计算规则,模型处理任意位置的内容时,绝对访问不到序列里排在它后面的内容,只能参考已经存在的输入、以及之前已经生成的token;第二类是过前馈神经网络,把每个位置的表征从最基础的字符特征,逐层抽象成词汇、语义关联、上下文共现模式的高维特征。

逐token生成的运算逻辑

GPT-3是纯自回归模型,从来不会一次性生成整段内容,永远是算完一个token、拼到序列末尾、再算下一个,循环到触发停止条件为止:

  • 处理完输入的Quack之后,模型最末端的输出头(线性层+Softmax激活)会吐出整个词表所有token接在当前序列后面的概率值。你测试时得到的第一个补全是Quackery,本质是采样时抽到了和Quack共现概率很高的-ery后缀token——这里根本不是模型乱拼,quackery本身就是固定英文单词,词义是庸医行骗、伪医疗骗局。
  • 生成Quackery之后,这个新token会被追加到输入序列末尾,模型重新跑一遍全量推理流程计算下一个token的概率:因为quackery的语义本身就和虚假医疗、无效疗法强绑定,GPT-3的训练语料里这个词和"抨击非正规疗法"类文本的共现权重本来就很高,如果当时的采样参数(比如temperature值偏高、top_p设置宽松)没有严格卡最高概率输出,就会顺着"伪医疗骗局"的语义链往下走,关联到细胞疗法相关的争议性内容。你看到的那段抨击细胞疗法的激烈言论,本质是模型沿着高概率语义路径逐token采样拼出来的文本,不代表模型有任何主观立场。

输出结果离奇的核心原因

  • GPT-3没有内置事实校验、逻辑对齐模块,不会主动判断"细胞疗法是不是属于伪医疗骗术",只要训练语料里存在对应的语义共现关联,采样时抽到就会顺着往下生成。
  • 短提示本身的语义约束极弱:Quack本身是多义词,既可以指鸭子的叫声,也可以指代庸医,第一次采样选到哪个语义分支,后续的内容就会完全往那个方向偏,你刚好碰到了模型选"伪医疗"语义分支的情况,才会觉得输出和输入完全不搭。
  • 如果没有手动调低采样随机度,Playground的默认参数本来就允许模型选概率排名不是第一的token,偶尔跳出用户预期的语义路径是非常常见的情况。

内容的提问来源于stack exchange,提问作者Andrew Short

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 01:36:15