Linux本地笔记本加载llama3 8位量化版(llama.cpp)内存溢出进程被杀求助
解决Llama.cpp加载8位量化Llama3内存超限的办法
- 关闭后台冗余进程:用
top或htop命令查看内存占用高的程序,关掉不用的浏览器标签页、大型软件,释放物理内存。 - 启用swap交换分区:如果系统没开swap,创建临时swap文件来补充内存。执行以下命令:
注意:swap依赖磁盘,速度比物理内存慢,仅作为临时缓解方案。sudo fallocate -l 8G /swapfile sudo chmod 600 /swapfile sudo mkswap /swapfile sudo swapon /swapfile - 调整llama.cpp启动参数:
- 加
--n-gpu-layers N参数,把部分模型层转移到GPU(有独立显卡的话),减少CPU内存占用。N可以从32开始尝试,逐步调整到合适数值。 - 加
--n_ctx 512缩小上下文窗口,降低内存消耗。
- 加
- 换用中间精度量化版本:比如6位量化模型,内存占用比8位低,精度又比4位好,平衡内存和效果。
- 优化系统内存策略:编辑
/etc/sysctl.conf文件,添加vm.swappiness=10(让系统优先用物理内存,迫不得已才用swap),然后执行sudo sysctl -p让配置生效。
内容的提问来源于stack exchange,提问作者Anagha
相关产品推荐
相关产品推荐

