Ollama API响应缓慢,如何确保调用GPU加速?
问题解答
一、代码与API调用问题排查
你贴出的代码仅完成了请求参数构造,缺少完整的HTTP请求发送逻辑,这是耗时差异的核心原因,需重点检查以下几点:
- 确认Godot的
HTTPRequest节点是否正确发起POST请求:
必须调用request()方法,传入URL、请求头、POST标识与请求体,补全示例代码:func send_to_ollama(message): var url = "http://localhost:11434/api/generate" var headers = ["Content-Type: application/json"] var body = JSON.stringify({ "model": "qwen2:1.5b", "prompt": message, "stream": false }) # 假设http_request是场景中已挂载的HTTPRequest节点引用 http_request.request(url, headers, true, body) - 避免同步阻塞:若在主线程同步等待响应会拖慢流程,建议通过
HTTPRequest的request_completed信号异步处理返回结果。 - 验证格式有效性:打印
body内容对比curl的请求体,确保JSON.stringify未生成无效格式。
你的API调用参数结构(model、prompt、stream)是正确的,和curl命令完全匹配,问题出在请求发送的实现细节上。
二、Ollama启用GPU设置
Ollama默认自动检测GPU,若未生效按以下步骤配置:
- 环境依赖检查:
- NVIDIA显卡:安装最新CUDA驱动与Toolkit,运行
ollama env查看OLLAMA_CUDA是否为1 - AMD显卡:Linux系统安装ROCm驱动(Windows暂不支持)
- macOS:系统版本≥12.0时,Ollama会自动启用Metal加速
- NVIDIA显卡:安装最新CUDA驱动与Toolkit,运行
- 强制启用GPU:
启动Ollama前设置环境变量:- Windows:
set OLLAMA_CUDA=1 - Linux/macOS:
export OLLAMA_CUDA=1
重启Ollama服务后,运行ollama run qwen2:1.5b,终端显示"using GPU"即表示生效。
- Windows:
- 模型兼容性:qwen2:1.5b属于官方支持GPU加速的模型,无需额外适配。
内容的提问来源于stack exchange,提问作者albusdemens
相关产品推荐
相关产品推荐

