基于GloVe预训练向量的类比任务相似性结果疑问
关于GloVe向量类比任务的疑问解答
为什么king最相似的是自己?
这完全是正常现象。不管用欧氏距离还是余弦相似度计算,目标词向量和自身的匹配度都是最高的——欧氏距离为0,余弦相似度为100%,所以它必然排在首位,这是所有词向量模型的通用表现,不用疑惑。king和queen的相似度只有86%是否合理?
首先要明确:你说的86%应该是余弦相似度(欧氏距离是绝对值,不会以百分比呈现)。50维的GloVe向量属于低维度版本,语义编码的粒度相对粗糙,king和queen的余弦相似度在85%-88%区间是完全正常的,符合这个维度模型的表现。提升维度会提高相似度吗?
是的。100维、200维甚至300维的GloVe向量能捕捉更丰富的语义细节,king和queen的余弦相似度会显著提升,通常能达到90%-95%的水平,和你预期的一致。
另外补充一点:经典类比任务“king - woman + man = queen”的核心是向量运算后的结果与queen向量的匹配度,不是直接看king和queen的相似度。如果你的运算结果能正确匹配到queen(哪怕相似度不是极高),说明模型的语义映射是有效的。
内容的提问来源于stack exchange,提问作者fede
相关产品推荐
相关产品推荐

