You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何理解Transformer中的语境化嵌入?同词为何有不同嵌入表示?

同形词在Transformer中为何有不同嵌入表示?

句子里的两个left看起来拼写一样,但在Transformer的输入处理环节,它们已经是完全不同的token了:

  • 第一个left是动词(表示“遗留、落下”),第二个left是形容词(表示“左侧的”),主流的分词工具(比如BERT用的WordPiece)会根据词性/语义差异,给这两个同形词分配不同的token ID。
  • 嵌入层的本质是基于token ID的查找表:每个token ID对应唯一的独热向量,不同的独热向量和嵌入矩阵E相乘后,得到的输入嵌入X自然就不一样。

说白了,模型根本不把它们当成同一个“词”,自然会给出不同的嵌入表示。

内容的提问来源于stack exchange,提问作者Vinay Sharma

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.05 00:02:05