You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Linux本地笔记本加载llama3 8位量化版(llama.cpp)内存溢出进程被杀求助

解决Llama.cpp加载8位量化Llama3内存超限的办法
  • 关闭后台冗余进程:用top或htop命令查看内存占用高的程序,关掉不用的浏览器标签页、大型软件,释放物理内存。
  • 启用swap交换分区:如果系统没开swap,创建临时swap文件来补充内存。执行以下命令:
    sudo fallocate -l 8G /swapfile
    sudo chmod 600 /swapfile
    sudo mkswap /swapfile
    sudo swapon /swapfile
    
    注意:swap依赖磁盘,速度比物理内存慢,仅作为临时缓解方案。
  • 调整llama.cpp启动参数:
    • 加--n-gpu-layers N参数,把部分模型层转移到GPU(有独立显卡的话),减少CPU内存占用。N可以从32开始尝试,逐步调整到合适数值。
    • 加--n_ctx 512缩小上下文窗口,降低内存消耗。
  • 换用中间精度量化版本:比如6位量化模型,内存占用比8位低,精度又比4位好,平衡内存和效果。
  • 优化系统内存策略:编辑/etc/sysctl.conf文件,添加vm.swappiness=10(让系统优先用物理内存,迫不得已才用swap),然后执行sudo sysctl -p让配置生效。

内容的提问来源于stack exchange,提问作者Anagha

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.21 18:39:53