Transformer翻译模型4/8位量化版本及指定模型量化情况咨询
Transformer翻译及非LLM模型的量化版本说明
整体情况
除大语言模型(LLMs)外,Transformer架构的翻译模型、T5这类序列到序列模型均支持量化——部分有官方预量化版本,其余可通过Hugging Face生态的工具自行实现量化。
你询问的具体模型情况
- Helsinki-NLP/opus-mt-zh-en:官方未提供预量化版本,但可通过
bitsandbytes或optimum库快速完成8-bit/4-bit量化,社区也有用户上传的量化版本可检索使用。 - Helsinki-NLP/opus-mt-tc-big-it-en:与同系列opus模型一致,无官方预量化版本,支持用
transformers结合量化工具自行处理,社区可能存在分享的量化实例。 - t5-small:官方支持INT8量化,加载时指定
load_in_8bit=True(需依赖bitsandbytes)即可直接使用,也支持自定义4-bit量化配置。 - facebook/nllb-200-distilled-600M:官方未发布预量化版本,但可通过
optimum的ONNX Runtime或bitsandbytes实现8-bit/4-bit量化,部分社区用户已上传量化后的模型版本。
快速量化示例代码
以bitsandbytes实现8-bit量化为例:
from transformers import AutoModelForSeq2SeqLM, AutoTokenizer model_id = "Helsinki-NLP/opus-mt-zh-en" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForSeq2SeqLM.from_pretrained(model_id, load_in_8bit=True, device_map="auto")
内容的提问来源于stack exchange,提问作者mary evans
相关产品推荐
相关产品推荐

