如何将tokenizer.json转换为tokenizer.model?解决LeoLM转GGUF格式需求
将tokenizer.json转换为tokenizer.model的方法
先安装所需依赖库,执行命令:
pip install transformers sentencepiece编写并运行Python脚本:
将以下代码保存为convert_tokenizer.py,放在存放tokenizer.json的目录下:from transformers import AutoTokenizer # 加载当前目录下的tokenizer.json文件 tokenizer = AutoTokenizer.from_pretrained(".", local_files_only=True) # 生成sentencepiece格式的tokenizer.model文件 tokenizer.save_pretrained(".", legacy_format=False)执行脚本:
python convert_tokenizer.py
运行完成后,当前目录会生成所需的tokenizer.model文件,该文件与LeoLM/leo-hessianai-7b仓库中的tokenizer.model内容一致,可直接用于llama.cpp的GGUF格式转换。
内容的提问来源于stack exchange,提问作者user2741831
相关产品推荐
相关产品推荐

