代理限制无法下载Huggingface Bert Tokenizer,需获取哪些源文件构建?
离线加载BERT Tokenizer所需文件说明
要离线使用BertTokenizer无需下载完整模型权重,仅需从对应Hugging Face仓库下载以下3个核心文件即可:
vocab.txt:BERT的官方词表,存储分词所需的所有字符、单词映射关系,为必须下载的核心文件tokenizer_config.json:存储当前Tokenizer的运行配置,包含是否自动小写、最大长度限制、截断/填充规则等参数,必须下载special_tokens_map.json:存储<[BOS_never_used_51bce0c785ca2f68081bfa7d91973934]>、[SEP]、[MASK]等特殊token的定义与映射关系,必须下载
下载完成后将所有文件放在同一个本地文件夹中,加载时直接传入本地文件夹路径即可,示例代码如下:
from transformers import BertTokenizer # 括号内替换为你存放下载文件的本地目录路径 bert_tokenizer_en = BertTokenizer.from_pretrained("./bert-base-uncased-local") bert_tokenizer_de = BertTokenizer.from_pretrained("./bert-base-german-cased-local")
内容的提问来源于stack exchange,提问作者Dametime
相关产品推荐
相关产品推荐

