Omnivoice与Gemma 4(llama.cpp)共存时推理速度骤降求助
Omnivoice调用后Gemma 4模型推理速度骤降问题求助
问题详情
我正在开发一款支持语音指令响应的机器人,目前通过llama.cpp运行Gemma 4 12B Q8模型,原本推理速度约40t/s。试用Omnivoice生成并发送音频文件后,Gemma处理新消息时推理速度骤降至约10t/s。
我怀疑是Omnivoice加载后占用了大量VRAM,导致llama.cpp检测到显存不足,将模型层转移到CPU并一直保持该状态。使用的显卡为RTX 5070Ti。
已尝试的无效方案
- 执行VRAM释放代码,代码能正常运行但无法解决速度问题:
del model gc.collect() if torch.cuda.is_available(): torch.cuda.empty_cache() torch.cuda.ipc_collect()
- 将Omnivoice封装在单独Python文件中,以子进程形式在主程序中调用,确保运行结束后释放资源,但问题依旧存在。
显存状态对比
- 加载Omnivoice前显存使用情况:

- 加载Omnivoice后显存使用情况:

内容的提问来源于stack exchange,提问作者Diego GT
相关产品推荐
相关产品推荐

