You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用SageMaker部署微调模型时出现设备空间不足错误

修复SageMaker部署Mistral-7B微调模型时的磁盘空间不足错误

排查方向

  • 核实模型工件大小:检查S3中model.tar.gz的实际大小,本地解压后查看总占用空间。Mistral-7B基础模型约13GB,全参数微调后的模型可能更大,若包含训练缓存、日志、多份checkpoint等冗余文件,体积会大幅膨胀。
  • 检查实例磁盘分区使用:通过SageMaker Debugger监控实例磁盘指标,或添加生命周期配置执行df -h命令,确认是根目录(/)还是EBS挂载目录(/opt/ml/model)空间不足。部分JumpStart镜像的根分区默认空间较小(如20GB),若模型临时解压到根目录下的/tmp(部分实例为内存挂载的tmpfs,空间有限),会触发该错误。
  • 校验模型工件内容:解压model.tar.gz,确认仅保留必要文件(如model.safetensors/pytorch_model.bin、config.json、tokenizer相关文件),排除训练数据、中间checkpoint、日志等无关大文件。

修复建议

1. 清理模型工件冗余内容

重新打包模型时,仅保留推理必需的文件:

# 示例:仅复制必要文件到打包目录
mkdir -p model_package
cp /path/to/finetuned/model/{model.safetensors,config.json,generation_config.json} model_package/
cp -r /path/to/finetuned/model/tokenizer* model_package/
tar -czf model.tar.gz -C model_package .

上传清理后的model.tar.gz到S3后重新部署。

2. 指定模型下载/解压路径到EBS卷

在Model初始化时添加环境变量,强制模型下载和解压到EBS挂载的/opt/ml/model目录下,避免占用根目录或内存tmpfs空间:

model = Model(
    image_uri=deploy_image_uri,
    source_dir=deploy_source_uri,
    model_data="s3://path/to/model/model.tar.gz",
    entry_point="inference.py",
    role=SAGEMAKER_ROLE,
    predictor_cls=Predictor,
    name=endpoint_name,
    environment={
        "SAGEMAKER_MODEL_DOWNLOAD_DIR": "/opt/ml/model/tmp_download",
        "SAGEMAKER_MODEL_UNPACK_DIR": "/opt/ml/model"
    }
)

3. 启用模型量化减小体积

若模型体积过大,使用GPTQ/AWQ等量化技术将模型压缩为4bit/8bit格式,大幅降低磁盘和内存占用。微调后量化或直接使用量化后的基础模型进行微调,再打包部署。

4. 自定义推理镜像(可选)

若JumpStart默认镜像的根分区空间不足,可基于原镜像构建自定义镜像,扩大根分区容量,或修改模型解压逻辑,确保所有临时文件写入EBS卷。

内容的提问来源于stack exchange,提问作者Comte_Zero

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.25 19:47:46