You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何修改Python代码以访问通过Ollama部署的Llama 3.3模型

问题描述

已通过以下命令在远程GPU上使用Ollama安装了Llama 3.3:

curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3.3

现在想要运行以下调用Llama 3.3的Python代码,请问需要对代码做哪些修改?

import transformers
import torch

model_id = "meta-llama/Llama-3.3-70B-Instruct"

pipeline = transformers.pipeline(
    "text-generation",
    model=model_id,
    model_kwargs={"torch_dtype": torch.bfloat16},
    device_map="auto",
)

messages = [
    {"role": "system", "content": "You are a pirate chatbot who always responds in pirate speak!"},
    {"role": "user", "content": "Who are you?"},
]

outputs = pipeline(
    messages,
    max_new_tokens=256,
)
print(outputs[0]["generated_text"][-1])
修改方案

原代码基于Hugging Face transformers 库直接加载模型,而你通过Ollama部署的Llama 3.3是通过API提供服务的,因此需要将逻辑改为调用Ollama API,具体修改如下:

1. 替换依赖库

移除transformers和torch,改用Ollama官方Python库(或直接用requests调用API)。若使用官方库,先执行安装命令:

pip install ollama

2. 调整代码逻辑

方式一:使用Ollama官方Python库

修改后的代码示例:

import ollama

# 若远程GPU的Ollama服务非本地访问,需设置服务地址
# ollama.set_base_url("http://远程GPU的IP:11434")

messages = [
    {"role": "system", "content": "You are a pirate chatbot who always responds in pirate speak!"},
    {"role": "user", "content": "Who are you?"},
]

# 调用Ollama的对话接口,指定模型为llama3.3
response = ollama.chat(
    model="llama3.3",
    messages=messages,
    options={"max_tokens": 256}
)

# 打印生成的回复内容
print(response['message']['content'])

方式二:直接用requests调用API

若不想安装Ollama的Python库,可直接通过HTTP请求调用:

import requests

# 远程GPU的Ollama服务地址,默认端口为11434
url = "http://远程GPU的IP:11434/api/chat"

messages = [
    {"role": "system", "content": "You are a pirate chatbot who always responds in pirate speak!"},
    {"role": "user", "content": "Who are you?"},
]

payload = {
    "model": "llama3.3",
    "messages": messages,
    "options": {"max_tokens": 256},
    "stream": False  # 关闭流式输出,直接获取完整结果
}

response = requests.post(url, json=payload)
result = response.json()
print(result['message']['content'])

3. 关键修改点说明

  • 不再需要指定Hugging Face的模型ID,直接使用Ollama中部署的模型名称llama3.3
  • 调用逻辑从本地加载模型改为调用Ollama的API接口,远程访问时需指定正确的服务地址
  • 输出结果的解析方式改为提取Ollama API返回的message.content字段

内容的提问来源于stack exchange,提问作者pkjpk

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.15 00:32:35