You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Hugging Face Tokenizer同一令牌对应两个ID,是Bug还是正常现象?

同一个字符对应两个Tokenizer ID:Bug还是预期设计?

我在加载Hugging Face Tokenizer时,想把序列</|im_end|>设为停止词,却发现同一个字符</>对应两个不同的ID(700和1867),相关代码如下:

from transformers import AutoTokenizer, AutoModelForCausalLM

tokenizer = AutoTokenizer.from_pretrained("LoneStriker/AlphaMonarch-7B-AWQ", device_map='cuda')
model = AutoModelForCausalLM.from_pretrained("LoneStriker/AlphaMonarch-7B-AWQ", device_map='cuda')

tokenizer.decode(700) #  '</'
tokenizer.decode(1867) # '</'
tokenizer.decode(700) == tokenizer.decode(1867)

这属于预期设计,并非Bug,核心原因和Tokenizer的子词分词逻辑有关:

  • 这类Tokenizer多基于Byte-level BPE算法(GPT系列模型常用的分词方式),词表中会同时存储两种令牌:一是单个字节对应的原始令牌,二是从训练语料中统计出的高频子词令牌。
  • 当</>出现在不同上下文时,Tokenizer会采用不同的拆分策略:比如单独出现的</>可能被映射为字节令牌ID,而作为</|im_end|>序列的一部分时,可能被识别为一个独立的子词令牌,对应另一个ID。虽然解码后显示的字符完全相同,但它们在词表中是两个独立条目,对应不同的模型嵌入向量。

如果要设置</|im_end|>为停止词,正确做法是直接将完整序列转换为令牌ID列表,而非单独处理单个字符:

stop_sequence = "</|im_end|>"
stop_ids = tokenizer.encode(stop_sequence, add_special_tokens=False)
# 生成文本时,将stop_ids作为停止条件传入即可

内容的提问来源于stack exchange,提问作者dimid

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.29 15:06:11