TensorFlow TextVectorization的adapt()结果及生成词汇表的查看方法
adapt() 操作的输出结果
adapt 没有显式返回值,它会直接更新 TextVectorization 层的内部状态,生成两类核心映射规则:
- 按词频从高到低排序的词汇表:最多保留你配置的
max_tokens个词汇,默认前两个位置为特殊标记:第一位是填充标记"",第二位是未登录词标记"[UNK]",后续位置为数据集中实际出现的词汇 - 字符串到整数的索引映射表:后续调用该层处理文本时,会直接通过该映射把文本转换为对应整数值
查看生成词汇表的方法
直接调用 TextVectorization 层的 get_vocabulary() 方法即可获取完整词汇表,示例代码如下:
# 获取包含特殊标记的完整词汇表 full_vocab = vectorize_layer.get_vocabulary() # 打印前10个词汇,默认前两个分别是填充标记、未登录词标记 print(full_vocab[:10]) # 如果不需要特殊标记,可传入参数过滤 pure_text_vocab = vectorize_layer.get_vocabulary(include_special_tokens=False) print(pure_text_vocab[:10]) # 查看当前词汇表实际大小 print("词汇表总长度:", len(full_vocab))
内容的提问来源于stack exchange,提问作者kiriloff
相关产品推荐
相关产品推荐

