You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将BERT预处理模型生成的token ids解码为单词?

BERT无大小写预处理模型Token IDs还原单词方案
  • bert_en_uncased_preprocess/3采用BERT原生无大小写分词规则,和TensorFlow Text中对应BERT分词器的ID映射完全一致,可直接用TF Text的detokenize功能还原文本。

  • 操作步骤:

    1. 加载与预处理模型匹配的BERT无大小写分词器
    2. 调用分词器的detokenize方法传入Token IDs,工具会自动处理子词拼接(比如将带##前缀的子词合并为完整单词)
  • 示例代码:

import tensorflow_text as tf_text
import tensorflow as tf

# 加载匹配uncased版本的BERT分词器
# 若需严格匹配,可传入BERT官方uncased版本的vocab.txt路径到vocab_file参数
tokenizer = tf_text.BertTokenizer(lower_case=True)

# 示例Token IDs(对应输入句"I am a boy")
token_ids = tf.constant([[101, 1045, 2572, 1037, 10352, 102]])
# 还原为文本
detokenized_result = tokenizer.detokenize(token_ids)
print(detokenized_result.numpy().decode('utf-8'))
# 输出:i am a boy
  • 注意事项:如果对ID映射存疑,可直接使用BERT官方提供的uncased版vocab.txt文件,确保分词器的词汇表和预处理模型完全对齐。

内容的提问来源于stack exchange,提问作者David S.

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 01:57:11