You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在gensim word2vec模型中查询二元词组的相似词汇

报错原因
  • 拼写失误:你输入的artifical intelligence存在拼写错误,正确拼写为artificial intelligence。
  • 模型token规则不符:word2vec-google-news-300预训练模型在训练阶段已将高频多词词组以下划线拼接为单个独立token,空格分隔的词组不会被识别为词汇表中的有效条目。
正确获取二元词组相似词汇的方法

方法1:使用模型内置的合并词组token

首先先检索确认对应词组在模型中的正确token写法:

# 检索词汇表中匹配人工智能相关的词组
for word in word2vec_model300.index_to_key:
    if "artificial" in word and "intelligence" in word:
        print(word)

执行后可以得到对应有效token为artificial_intelligence,之后直接调用查询接口即可:

# 查询单个词组的相似词
print(word2vec_model300.most_similar("artificial_intelligence", topn=10))
# 同时匹配AI和人工智能两个概念的相似词
print(word2vec_model300.most_similar(positive=["AI", "artificial_intelligence"], topn=20))

方法2:向量均值查询(适用于未被合并收录的词组)

如果你要查询的二元词组没有被模型收录为合并token,可以先计算两个单词语义向量的平均值,再用平均值查询相似结果:

import numpy as np

# 计算两个单词的向量均值
avg_vec = (word2vec_model300["artificial"] + word2vec_model300["intelligence"]) / 2
# 用平均向量查询相似词
print(word2vec_model300.similar_by_vector(avg_vec, topn=10))
注意事项

所有该模型内置的多词词组都遵循下划线拼接规则,比如machine_learning、deep_learning、natural_language_processing都是对应的有效token,查询其他多元词组时也可遵循该规则提前验证token是否存在。

内容的提问来源于stack exchange,提问作者Joesf.Albert

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 15:06:09