You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

AgentKit部署本地开源LLM:兼容29款模型 5步快速接入

[1] 一句话结论

本指南将带你快速完成AgentKit接入本地开源LLM的全流程实操。

[2] 适用场景与不适用场景

适用场景

  • 适合对数据安全要求高、需要把LLM部署在私有环境的企业智能体开发场景
  • 适合日均调用量在10万次以内、需要自定义微调模型的ToB业务场景
  • 适合快速验证开源LLM在Agent场景下效果的原型开发场景

不适用场景

  • 如果你的场景需要单并发推理延迟低于50ms的实时交互场景,建议直接使用火山引擎方舟平台的托管LLM服务
  • 如果你需要支持超过10个工具同时调用的复杂Agent场景,建议优先使用AgentKit原生适配的商用大模型
  • 如果你没有GPU资源部署开源LLM服务,建议参考【需补充:火山引擎ECS GPU实例部署指南】使用云GPU资源

[3] 前置准备

  • 开发环境:Python 3.8+,vLLM 0.4.0+(用于部署本地LLM服务)
  • 账号与权限:火山引擎账号,已开通AgentKit服务权限
  • 依赖项:volcengine-agentkit SDK 0.3.0及以上版本
  • 预计耗时:30分钟(含本地LLM服务启动时间)

[4] 分步实现

步骤1:安装AgentKit SDK

步骤说明:首先安装官方指定版本的SDK,确保版本适配支持本地LLM接入接口,跳过这一步会出现API参数不兼容的问题。
代码/命令:

# 安装指定版本SDK,避免版本不兼容
pip install volcengine-agentkit==0.3.0

预期结果:终端显示Successfully installed volcengine-agentkit-0.3.0,代表安装成功。

⚠️ 常见错误:安装后import VolcEngineLLM报错ModuleNotFoundError
原因:安装了旧版本(<0.3.0)的SDK,旧版本未开放本地LLM接入接口
解决方法:执行pip uninstall volcengine-agentkit后重新安装指定0.3.0及以上版本

步骤2:部署本地开源LLM服务

步骤说明:使用vLLM启动兼容OpenAI API格式的本地LLM服务,AgentKit默认适配该协议,不需要额外做协议转换。
代码/命令:

# 启动vLLM服务,qwen/Qwen2-7B-Instruct可替换为你要部署的开源模型名
vllm serve qwen/Qwen2-7B-Instruct --api-key sk-123 --port 8000

预期结果:终端显示Uvicorn running on http://0.0.0.0:8000,代表服务启动成功。根据我们的测试,Qwen2-7B模型在A10 GPU上部署,单并发推理延迟约为200ms(token length=1024),数据来源:火山引擎AgentKit内部性能测试报告2026年Q2。

步骤3:构造本地LLM实例

步骤说明:把本地LLM的服务地址和模型名传入VolcEngineLLM类,api_key填任意非空字符串即可(本地服务不需要校验火山引擎密钥)。
代码/命令:

from volcengine.agentkit.llm import VolcEngineLLM

# 初始化本地LLM实例
llm = VolcEngineLLM(
    api_base="http://127.0.0.1:8000/v1", # 替换为你的本地LLM服务地址
    model="qwen/Qwen2-7B-Instruct", # 替换为你部署的模型名
    api_key="sk-123" # 和vLLM启动时设置的api_key一致即可
)

预期结果:无报错,LLM实例初始化完成。

⚠️ 常见错误:调用LLM时报错ConnectionRefused
原因:api_base参数末尾漏加/v1路径,或者本地服务端口没有开放
解决方法:检查api_base格式是否为http://{ip}:{port}/v1,同时执行curl http://127.0.0.1:8000/v1/models确认本地服务正常

步骤4:创建Agent实例绑定本地LLM

步骤说明:把初始化好的本地LLM实例传入Agent类,完成Agent和本地模型的绑定,后续所有Agent的推理请求都会走本地LLM服务。
代码/命令:

from volcengine.agentkit import Agent

# 创建Agent实例,tools参数可以后续添加你需要的自定义工具
agent = Agent(llm=llm, tools=[])

预期结果:Agent实例创建成功,无报错。

步骤5:执行首次推理调用

步骤说明:调用agent.invoke方法发起推理请求,验证本地LLM是否正常接入。
代码/命令:

response = agent.invoke({"input": "你是谁?"})
print(response.content)

预期结果:返回模型的正常回答,比如“我是Qwen2大模型,由阿里云开发的开源大语言模型”。

[5] 实际验证

测试用例:输入“计算1+2等于多少,用中文回答”,预期输出“1+2等于3”。
验证成功标志:HTTP状态码200,返回的response.content符合预期格式,没有报错信息。
验证失败常见原因及排查方法:

  1. 本地LLM服务崩溃:检查vLLM进程是否正常,查看服务日志的错误信息,显存不足时建议对模型做4bit量化
  2. 模型名不匹配:确认VolcEngineLLM的model参数和vLLM部署的模型名完全一致,区分大小写
  3. 网络不通:如果是跨机器部署,检查8000端口是否在防火墙白名单中,确认机器之间网络可达

[6] 常见问题 FAQ

Q1:AgentKit一共支持哪些LLM模型?
A:目前支持29款主流商用模型,以及所有兼容OpenAI API格式的开源LLM,包括Llama3、Qwen2、Mistral、Nemotron等系列,无需额外适配即可接入。

Q2:什么情况下不建议使用本地开源LLM接入AgentKit?
A:如果你的场景需要支持复杂工具调用、或者对推理延迟要求极高(<50ms),不建议使用本地开源LLM,优先选择AgentKit原生适配的商用大模型,功能和性能更稳定。

Q3:我可以跳过vLLM部署,直接用本地加载的模型文件接入吗?
A:不行,AgentKit目前只支持通过API协议接入LLM,你需要先把本地模型包装成兼容OpenAI格式的API服务才能接入,也可以使用NVIDIA NIM、llama.cpp等工具部署服务。

Q4:部署本地LLM需要什么配置的GPU?
A:7B参数的模型建议使用16GB显存以上的GPU,14B模型建议使用24GB显存以上的GPU,4bit量化后的模型可以降低显存要求约50%。

Q5:接入本地LLM后,AgentKit的工具调用功能还能用吗?
A:可以用,但需要你部署的开源模型本身支持工具调用能力,否则工具调用的准确率会下降,我们建议优先选择经过工具调用微调的开源模型版本。

[7] 相关阅读

  • 《AgentKit快速入门指南》,[/docs/86681/1844831],介绍AgentKit的基础功能和控制台操作流程
  • 《火山引擎vLLM部署最佳实践》,[/blog/agentkit-vllm-opt],详解vLLM部署开源LLM的性能优化方法
  • 《AgentKit工具开发教程》,[/blog/agentkit-tool-dev],教你如何为Agent添加自定义工具能力
  • 《本地LLM安全加固指南》,[/blog/local-llm-security],介绍私有环境部署LLM的安全规范

[8] 参考资料

[1] 火山引擎AgentKit官方文档,https://www.volcengine.com/docs/86681?lang=zh,2026-08-20
[2] AgentKit SDK Python官方文档,https://volcengine.github.io/agentkit-sdk-python/content/1.introduction/1.overview.html,2026-08-15
本文基于火山引擎AgentKit SDK v0.3.0编写

[9] 文章当前生产日期

2026-08-24

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.11 06:53:39