You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用vllm在AMD RX 9070XT运行Phi-4多模态LLM时遇显存不足问题

问题描述

尝试在本地运行微软Phi-4多模态指令LLM模型,采用vllm框架,已安装ROCm 6.4.1,使用指定Docker镜像启动容器,启动命令:

docker run -it --network=host --group-add=video --ipc=host --cap-add=SYS_PTRACE --security-opt seccomp=unconfined --privileged --device /dev/kfd --device /dev/dri -v  /home/kiyugad/dockerx:/app/models rocm/vllm:latest

运行时触发torch.OutOfMemoryError,报错信息:

torch.OutOfMemoryError: HIP out of memory. Tried to allocate 1000.00 MiB. GPU 0 has a total capacity of 15.92 GiB of which 668.00 MiB is free. Of the allocated memory 14.35 GiB is allocated by PyTorch, and 66.21 MiB is reserved by PyTorch but unallocated. If reserved but unallocated memory is large try setting PYTORCH_HIP_ALLOC_CONF=expandable_segments:True to avoid fragmentation. See documentation for Memory Management

原本认为AMD RX 9070XT的16GB显存足以运行该模型,疑问:

  1. Phi-4多模态模型是否超出16GB显存承载?
  2. 该如何解决此显存不足问题?
解答

1. Phi-4多模态模型是否超出16GB显存承载?

Phi-4多模态指令模型(7B参数规模)在FP16精度下,模型本身显存占用约14GB(7B参数 × 2字节/参数),但vllm运行时还需额外显存用于KV缓存、框架调度开销、输入输出处理等,这些额外开销通常占1-3GB。你的RX 9070XT实际可用显存约15.92GB,加上系统和容器本身的显存占用,刚好会触发OOM。16GB显存属于临界可用状态,并非绝对无法承载,但需要针对性优化才能稳定运行。

2. 显存不足的解决方法

  • 优化显存碎片:按照报错提示设置环境变量,修改容器启动命令,添加显存碎片优化参数:
    docker run -it --network=host --group-add=video --ipc=host --cap-add=SYS_PTRACE --security-opt seccomp=unconfined --privileged --device /dev/kfd --device /dev/dri -e PYTORCH_HIP_ALLOC_CONF=expandable_segments:True -v  /home/kiyugad/dockerx:/app/models rocm/vllm:latest
    
    该设置可减少显存碎片,提升可用显存利用率。
  • 启用模型量化:启动vllm时指定4-bit或8-bit量化,比如添加--quantization awq或--quantization gptq参数。量化后模型显存占用会大幅降低(4-bit下约7GB左右),同时保留大部分推理性能。
  • 限制上下文长度:通过--max-model-len参数限制最大上下文长度,比如设置--max-model-len 2048,减少KV缓存的显存占用,这是降低额外显存开销的有效方式。
  • 清理冗余进程:启动容器前用rocm-smi查看GPU显存占用,杀掉无关进程释放显存,避免容器启动前已有显存被占用。
  • 关闭非必要功能:如果不需要动态批处理等高级特性,可禁用相关选项,减少vllm框架本身的显存开销。

内容的提问来源于stack exchange,提问作者KiYugadgeter

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.12 20:05:07