如何理解Transformer中的语境化嵌入?同词为何有不同嵌入表示?
同形词在Transformer中为何有不同嵌入表示?
句子里的两个left看起来拼写一样,但在Transformer的输入处理环节,它们已经是完全不同的token了:
- 第一个
left是动词(表示“遗留、落下”),第二个left是形容词(表示“左侧的”),主流的分词工具(比如BERT用的WordPiece)会根据词性/语义差异,给这两个同形词分配不同的token ID。 - 嵌入层的本质是基于token ID的查找表:每个token ID对应唯一的独热向量,不同的独热向量和嵌入矩阵
E相乘后,得到的输入嵌入X自然就不一样。
说白了,模型根本不把它们当成同一个“词”,自然会给出不同的嵌入表示。
内容的提问来源于stack exchange,提问作者Vinay Sharma
相关产品推荐
相关产品推荐

