You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Omnivoice与Gemma 4(llama.cpp)共存时推理速度骤降求助

Omnivoice调用后Gemma 4模型推理速度骤降问题求助

问题详情

我正在开发一款支持语音指令响应的机器人,目前通过llama.cpp运行Gemma 4 12B Q8模型,原本推理速度约40t/s。试用Omnivoice生成并发送音频文件后,Gemma处理新消息时推理速度骤降至约10t/s。

我怀疑是Omnivoice加载后占用了大量VRAM,导致llama.cpp检测到显存不足,将模型层转移到CPU并一直保持该状态。使用的显卡为RTX 5070Ti。

已尝试的无效方案

  • 执行VRAM释放代码,代码能正常运行但无法解决速度问题:
del model
gc.collect()
if torch.cuda.is_available():
    torch.cuda.empty_cache()
    torch.cuda.ipc_collect()
  • 将Omnivoice封装在单独Python文件中,以子进程形式在主程序中调用,确保运行结束后释放资源,但问题依旧存在。

显存状态对比

  • 加载Omnivoice前显存使用情况:
    加载Omnivoice前显存状态
  • 加载Omnivoice后显存使用情况:
    加载Omnivoice后显存状态

内容的提问来源于stack exchange,提问作者Diego GT

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.09 15:05:13