基于TF-IDF做t-SNE时欧氏与余弦距离图为何高度相似
TF-IDF语料t-SNE可视化中余弦距离与欧氏距离结果高度相似的原因
- 归一化后的距离等价性:绝大多数TF-IDF向量化流程默认会对输出向量做L2归一化,此时两种距离存在严格的数学对应关系:对两个L2归一化后的向量
u、v,余弦距离为1 - u·v,欧氏距离的平方为||u-v||² = 2*(1 - u·v),即欧氏距离是余弦距离的固定倍数,所有样本对的距离相对排序完全一致。t-SNE的核心是保留局部邻域的相对关系,只要邻域排序不变,最终低维嵌入只会出现旋转、坐标轴翻转这类刚体变换差异,不会产生结构区别。 - TF-IDF稀疏特性的趋同作用:就算没有手动做L2归一化,TF-IDF向量本身的高稀疏性也会让两种距离的计算结果高度趋同。TF-IDF向量非零维度占比通常不足10%,单篇文档向量的模长差异(对应文章长度、词频总量差异)对距离计算的影响,远小于文档用词重合度带来的向量夹角差异,两种度量下得到的样本近邻集合重合度极高。
- t-SNE算法的局部保序特性:t-SNE本身不保留全局绝对距离,仅以困惑度(perplexity)参数划定每个点的局部近邻范围,优化目标是让高维近邻点在低维也尽可能靠近。只要两种距离度量下每个点的近邻列表基本一致,哪怕远距离样本的距离数值差异很大,最终生成的可视化布局也不会有可感知的结构差异,你观察到的坐标轴调换属于高维结构一致时低维嵌入的正常随机旋转/镜像现象,不属于计算错误。
你可以通过简单计算验证这个结论:随机抽取100对文档,分别计算两种距离值,再计算两组距离值的斯皮尔曼相关系数,结果通常会在0.9以上,直接说明两种距离在你的语料上对样本对的相似度排序几乎完全一致。
内容的提问来源于stack exchange,提问作者HenkieTee
相关产品推荐
相关产品推荐

