关于分布式语义模型中词分布与向量相似度关系的技术问询
解答:词分布对向量距离的影响及相关研究
一、使中心词与两词向量距离相等的分布条件
首先,基于你设定的前提(beautiful仅与lady和boy共现,无其他上下文干扰),结合主流分布式语义模型的机制来分析:
不管是word2vec(Skip-gram/CBOW)还是GloVe,核心条件都是**lady和boy在beautiful的上下文分布中完全对称**,具体拆解:
- 对于word2vec系列:这类模型靠上下文预测任务学习向量。当
lady和boy作为beautiful的上下文词的共现概率完全相等时(比如每10次beautiful出现,各有5次搭配lady、5次搭配boy),它们对beautiful向量的更新贡献完全对称,最终beautiful与两者的向量距离会相等。哪怕总语料里的绝对频次不同(比如100次共现里50次lady、50次boy,或者20次里各10次),只要相对比例是1:1,结果就一致。(如果考虑负采样/高频下采样,只要两者的相对频次比例不变,采样后的有效贡献还是对称的) - 对于GloVe:它直接基于全局共现矩阵优化。当
beautiful与lady、boy的共现频次完全相等时,模型的加权损失函数会赋予两者完全相同的优化权重,最终让beautiful与它们的向量距离相等。
简单总结:只要lady和boy出现在beautiful上下文里的频率(或概率)完全一致,就能满足向量距离相等的要求。
二、研究词分布对向量生成主导作用的相关文献
当然有不少经典研究聚焦这个方向,这里列举几个核心的:
- 《Distributed Representations of Words and Phrases and their Compositionality》(Mikolov et al., 2013):word2vec的核心论文,详细阐述了共现上下文如何直接影响向量学习,尤其是Skip-gram/CBOW模型中,共现频次与向量相似度的对应关系,还讨论了负采样等策略如何基于频次调整向量学习过程。
- 《GloVe: Global Vectors for Word Representation》(Pennington et al., 2014):GloVe的原始论文,专门针对全局共现矩阵的特性,量化了词共现频率与向量相似度之间的数学关系,明确了分布频次是向量生成的核心驱动力。
- 《Improving Word Representations via Global Context and Multiple Word Prototypes》(Reisinger & Mooney, 2010):这篇研究探讨多原型词向量,深入分析了不同分布模式如何塑造词的不同向量原型,进一步验证了分布对向量的主导作用。
- 《On the Role of Context in Word Embeddings》(Arora et al., 2016):从理论层面推导了词向量与上下文分布的数学联系,证明词向量本质上是上下文分布的线性变换,直接确立了分布在向量生成中的核心地位。
内容的提问来源于stack exchange,提问作者sezar sampaio
相关产品推荐
相关产品推荐

