Gensim 4.0.1版本FastText模型如何获取词汇表或对应词索引?
Gensim FastText获取词汇表方法(适配4.0+版本)
你使用的4.0+版本Gensim已经提供了对应属性,完全可以实现类似TensorFlow Tokenizer的word_index效果:
- 获取词汇到索引的映射字典:调用
model.wv.key_to_index,返回值结构为{词汇字符串: 对应索引整数},和word_index功能完全一致 - 直接获取所有词汇的有序列表:调用
model.wv.index_to_key,列表按词汇出现频次从高到低排序
你可以在你的测试代码末尾添加以下代码验证效果:
# 等价于TensorFlow的word_index word_index = model.wv.key_to_index print("词汇到索引的映射:", word_index) # 获取全部词汇列表 all_vocab = model.wv.index_to_key print("全部词汇:", all_vocab)
注意:Gensim 3.x版本的
model.wv.vocab接口在4.x版本已经废弃,不要使用旧接口避免报错。
内容的提问来源于stack exchange,提问作者data_person
相关产品推荐
相关产品推荐

