You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Intel Mac上Ollama调用Llama 3.1 API响应过慢问题求助

解决Intel Mac上Ollama API调用响应缓慢的问题

排查与修复步骤

  • 强制Ollama使用CPU推理(禁用Metal)
    Intel Mac的Metal支持存在兼容性问题,终端运行时默认走CPU路径,但API调用可能误触发Metal逻辑。执行以下命令重启Ollama服务:

    OLLAMA_METAL=0 ollama serve
    

    多数Intel用户反馈这能直接解决延迟问题。

  • 调整API请求参数配置
    检查API请求的stream参数,若设为false,Ollama会等待完整生成后再返回,大模型场景下耗时会被放大。改为true流式返回,同时匹配硬件调整线程数与上下文窗口:

    {
      "model": "llama3.1",
      "prompt": "你的问题",
      "stream": true,
      "num_thread": 8,
      "num_ctx": 2048
    }
    

    num_thread可设为CPU核心数(8核Intel可设为8或16,利用超线程),避免线程调度资源浪费。

  • 重新拉取Intel兼容的模型文件
    部分用户反映模型下载时可能获取了Apple Silicon优化版本,重新拉取适配Intel的模型:

    ollama pull llama3.1:latest --platform linux/amd64
    

    拉取完成后重启Ollama服务再测试API。

  • 重置Ollama后台服务启动方式
    先停止系统默认的Ollama后台服务:

    brew services stop ollama
    

    再用禁用Metal的命令手动启动服务,确保API调用走正确的CPU推理路径。

内容的提问来源于stack exchange,提问作者Ruby

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.20 06:52:01