You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

TensorFlow TextVectorization的adapt()结果及生成词汇表的查看方法

adapt() 操作的输出结果

adapt 没有显式返回值,它会直接更新 TextVectorization 层的内部状态,生成两类核心映射规则:

  • 按词频从高到低排序的词汇表:最多保留你配置的 max_tokens 个词汇,默认前两个位置为特殊标记:第一位是填充标记 "",第二位是未登录词标记 "[UNK]",后续位置为数据集中实际出现的词汇
  • 字符串到整数的索引映射表:后续调用该层处理文本时,会直接通过该映射把文本转换为对应整数值
查看生成词汇表的方法

直接调用 TextVectorization 层的 get_vocabulary() 方法即可获取完整词汇表,示例代码如下:

# 获取包含特殊标记的完整词汇表
full_vocab = vectorize_layer.get_vocabulary()
# 打印前10个词汇,默认前两个分别是填充标记、未登录词标记
print(full_vocab[:10])

# 如果不需要特殊标记,可传入参数过滤
pure_text_vocab = vectorize_layer.get_vocabulary(include_special_tokens=False)
print(pure_text_vocab[:10])

# 查看当前词汇表实际大小
print("词汇表总长度:", len(full_vocab))

内容的提问来源于stack exchange,提问作者kiriloff

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 05:36:04