You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

OpenAI Embeddings技术疑问:向量与文本关联及相似度异常

关于OpenAI Embeddings的疑问解答

疑问1:超长数值列表与文本"I live in space"的关联

这个超长数值列表就是你输入文本的语义向量编码。Embedding模型的核心作用是把自然语言转换成高维空间里的一组数值,每个数值对应向量在某一维度上的坐标。这些维度不是对应单个单词,而是捕捉了文本的抽象语义——比如“space”指向的太空场景、“live in”表达的居住关系这类信息。模型经过训练后,会把语义相近的文本映射到空间中距离较近的位置,所以这个长列表本质是把你那四个词的语义转换成了机器可识别的数字化形式。

疑问2:相同文本用不同模型生成的Embedding余弦相似度不为1的原因

你用到的textsearchcuriedoc001mc和textsearchcuriequery001mc是一对分工明确的配对模型:

  • textsearchcuriedoc001mc专门为文档内容生成Embedding,侧重编码文档的完整语义
  • textsearchcuriequery001mc专门为查询语句生成Embedding,侧重提炼用户查询的核心意图

二者的训练目标不同,哪怕输入完全相同的文本,编码逻辑也存在差异,生成的向量自然不会一致,因此余弦相似度不会是1。这类配对模型的设计初衷是让查询向量能和相关文档向量产生更高的匹配度,而非让同一段文本的文档版与查询版Embedding完全重合。


内容的提问来源于stack exchange,提问作者Manu Chadha

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 08:47:27