Hugging Face上Llama 2不同格式模型文件大小差异原因咨询
关于Llama 2 7B模型不同版本大小差异的解释
核心差异根源:权重精度与存储格式
原始
meta-llama/Llama-2-7b的consolidated.00.pth(13.5GB):
这是Meta官方发布的FP16(半精度)纯权重文件,仅存储模型训练完成的参数,无冗余的梯度、优化器状态或额外元数据。Llama 2 7B实际参数约7.2亿,按FP16每个参数占2字节计算,总大小约为7.2e9 × 2字节 ≈ 13.1GB,和实际的13.5GB误差来自参数统计的精确值。HF兼容版
meta-llama/Llama-2-7b-hf的PyTorch文件(合计27GB):
这类文件默认存储FP32(单精度)权重,FP32每个参数占4字节,总大小为7.2e9 × 4字节 ≈ 26.8GB,和27GB的数值完全匹配。部分工具在将原始Llama 2模型适配HF Transformers格式时,未做精度压缩,直接保留FP32格式权重,导致体积翻倍。HF兼容版的safetensors文件(合计13.5GB):
safetensors是专为模型权重设计的高效存储格式,这里的文件同样采用FP16半精度存储,和原始.pth的权重精度一致,因此体积完全相同。同时safetensors不包含PyTorch格式附带的额外序列化元数据,体积控制更精准。
关于HF缓存仅下载safetensors的说明
Hugging Face Hub默认优先推荐体积更小、加载更快的safetensors格式文件,缓存机制会自动检测并下载该格式,避免重复下载同精度的PyTorch文件,节省存储资源。
内容的提问来源于stack exchange,提问作者Kumar Saurabh
相关产品推荐
相关产品推荐

