Huggingface Tokenizer未按参数添加padding tokens问题咨询
问题解答
核心原因是混淆了
padding=True和padding='max_length'的行为差异:padding=True的默认逻辑是仅将序列填充到当前batch中的最长序列长度,如果你的输入只有单条prompt且长度为52,自然不会填充到200。- 要强制填充到指定的
max_length,必须显式设置padding='max_length'。
padding操作是在Tokenizer编码阶段执行的,并非等到输入模型时才处理,只要参数设置正确,编码后的
input_ids就会直接达到目标长度。修正后的代码示例:
from transformers import AutoTokenizer tokenizer = AutoTokenizer.from_pretrained("你的模型路径") prompt = "待翻译的日语文本" inputs = tokenizer( prompt, padding='max_length', # 替换原padding=True参数 max_length=200, truncation=True, return_tensors="pt" ) print(inputs['input_ids'].shape) # 此时会输出 torch.Size([1, 200])
补充说明:ALMA属于Decoder-only架构,其Tokenizer默认采用右padding,无需额外调整方向参数,只要设置padding='max_length'即可触发强制填充逻辑。
内容的提问来源于stack exchange,提问作者Labyrinthian
相关产品推荐
相关产品推荐

