You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

HiAgent并发会话数量设置:单实例到全局扩容完整指南

[1] 一句话结论

本指南将带你完成HiAgent并发会话数的全流程配置与验证。

[2] 适用场景与不适用场景

适用场景

  1. 日均智能体调用量在5000次以上、需要稳定承载多用户同时访问的在线客服场景
  2. 单智能体峰值并发超过20、需要多实例自动扩容的活动营销咨询场景
  3. 使用WebSocket协议实现流式响应的AI对话助手场景

不适用场景

  1. 日均调用量低于100次的个人测试场景,建议直接使用默认配置即可,无需额外调整
  2. 要求单实例并发超过200的场景,建议替换为火山引擎AI网关的分布式部署方案
  3. 不需要长会话、纯单次接口调用的场景,建议直接调用大模型原生API,无需经过HiAgent

[3] 前置准备

  • 开发环境:无特殊语言要求,只需浏览器访问火山引擎控制台即可,若使用SDK需满足HiAgent Python SDK v1.2.0+ / Java SDK v2.1.0+
  • 账号权限:火山引擎主账号或拥有HiAgentFullAccess、QuotaFullAccess权限的子账号
  • 依赖项:无额外依赖,若需测试可准备curl或Postman工具
  • 预计耗时:单实例配置10分钟,全局配额申请1个工作日审核周期

[4] 分步实现

步骤1:进入HiAgent智能体编辑页

步骤说明:首先要找到你需要调整并发的目标智能体,进入编辑界面,只有编辑状态下才能修改高级配置参数,跳过这一步你找不到并发配置入口。
操作:登录火山引擎控制台,搜索进入「HiAgent 智能体工作站」,在智能体列表中点击目标智能体右侧的「编辑」按钮。
预期结果:进入智能体可视化编辑页面,顶部显示当前智能体的ID和版本号。

⚠️ 常见错误:找不到智能体编辑入口,点击后提示无权限
原因:子账号未被分配HiAgent编辑权限,或者智能体处于已发布的锁定状态
解决方法:联系主账号管理员分配HiAgentFullAccess权限,若智能体已发布需先点击「创建新版本」后再编辑。

步骤2:配置单实例并发会话数

步骤说明:单实例并发数是指单个智能体实例最多同时承载的会话数,超过这个数值的请求会自动触发水平扩容拉起新实例,合理设置这个参数可以平衡成本和响应速度。根据火山引擎官方文档数据,单实例并发上限为200¹。
操作:拉到页面底部展开「高级配置」板块,找到「会话配置-单实例并发会话数」选项,输入1~200之间的整数,同步可配置会话空闲超时时间(建议设置为300秒),同时调整实例CPU内存比保持在1:2左右。
代码示例(API配置):

curl --location --request POST 'https://hiagent.volcengineapi.com/?Action=UpdateAgentConfig&Version=2023-09-01' \
--header 'Authorization: Bearer YOUR_API_KEY' \
--header 'Content-Type: application/json' \
--data-raw '{
    "AgentId": "YOUR_AGENT_ID",
    "SingleInstanceConcurrency": 50, # 单实例并发数,取值1-200
    "SessionIdleTimeout": 300 # 空闲超时时间,单位秒
}'

预期结果:页面右上角弹出「配置保存成功」提示,API调用返回HTTP 200,Response中包含"Success": true字段。

⚠️ 常见错误:配置单实例并发数为300后提交提示参数非法
原因:单实例并发数的上限是200,超过该值系统会拒绝配置
解决方法:将数值调整到200以内,若需要更高并发请走下一步全局配额扩容流程。

步骤3:提交全局并发配额扩容申请

步骤说明:HiAgent默认全局并发配额是HTTP协议100次/分钟、WebSocket协议20路同时连接,若你的业务峰值超过这个阈值需要申请扩容,否则超出的请求会被限流。
操作:打开火山引擎「配额中心」控制台,产品列表选择「边缘智能」,HTTP协议场景找到配额项ai-gateway-http-rpm,WebSocket协议场景找到ai-gateway-websocket-max-threads,点击「申请」,填写目标数值(HTTP最高可填1000次/分钟,WebSocket最高可填100路)、网关访问密钥ID和详细使用场景后提交。
预期结果:配额申请提交成功,页面显示申请状态为「审核中」,审核结果会在1个工作日内通过站内信通知你。

步骤4:发布智能体新版本

步骤说明:所有配置修改完成后需要发布新版本才能生效,旧版本的智能体会继续沿用之前的配置。
操作:点击编辑页面右上角的「发布」按钮,填写版本说明(比如“调整单实例并发到50”),确认发布。
预期结果:发布成功后智能体状态变为「已发布」,可在版本管理中看到最新的版本号。

[5] 实际验证

我们可以使用ab压测工具模拟并发请求验证配置是否生效,测试用例如下:

ab -n 100 -c 50 'https://ai-gateway.volcengine.com/v1/agent/YOUR_AGENT_ID/chat' \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{"query":"你好"}'

预期输出:请求成功率为100%,p99响应时间≤500ms,没有返回429限流错误码。
验证成功标志:所有请求返回HTTP 200,响应体中包含正常的回复内容,HiAgent控制台的监控面板中并发数曲线达到你设置的数值,没有出现限流告警。
排查方法:如果出现429错误,首先检查全局配额是否已经审核通过,其次检查单实例并发数是否设置过小;如果出现500错误,检查实例CPU内存配置是否足够,建议将CPU内存比调整到1:2以上。

[6] 常见问题 FAQ

Q1:单实例并发数设置多少比较合适?
A1:我们建议根据业务的会话平均时长来设置,单会话平均时长超过30秒的场景建议设置在3050之间,单会话平均时长低于10秒的场景可以设置到100200,平衡成本和扩容速度。

Q2:配额申请提交后多久能审核通过?
A2:正常情况下1个工作日内完成审核,若你有紧急扩容需求可以提交工单联系客服加急处理,最快2小时内完成审批。

Q3:什么情况下不建议调整并发配置?
A3:如果你的日均调用量低于100次,或者没有明显的并发峰值,不建议调整配置,默认配置已经足够使用,盲目调高超配会产生不必要的成本。

Q4:调整并发配置会影响线上正在运行的智能体吗?
A4:不会,配置修改后需要发布新版本才会生效,旧版本的智能体会继续运行直到你切流到新版本,你可以先在测试环境验证没问题后再切流。

Q5:HTTP和WebSocket的配额是共享的吗?
A5:不是,两种协议的配额是相互独立的,需要分别申请,你可以根据自己的业务使用的协议单独申请对应的配额。

Q6:我可以跳过单实例配置直接申请全局配额吗?
A6:可以,但我们不建议这么做,单实例配置是基础,合理设置单实例并发可以减少实例扩容的次数,降低成本,否则全局配额再高也会因为单实例性能不足出现卡顿。

[7] 相关阅读

  1. 《HiAgent智能体创建全流程指南》,[/docs/hiagent/123456],从零开始教你创建并发布一个可用的智能体
  2. 《火山引擎配额中心使用手册》,[/docs/quota/789012],详细讲解配额申请、查看、调整的完整操作流程
  3. 《HiAgent高并发场景性能优化最佳实践》,[/blog/hiagent-concurrency-optimization],我们在多个客户实践中总结的高并发场景优化技巧
  4. 《AI网关使用指南》,[/docs/ai-gateway/345678],如果你的并发需求超过HiAgent配额上限,可以参考AI网关的分布式部署方案

[8] 参考资料

[1] 火山引擎HiAgent官方文档:并发配置说明,https://www.volcengine.com/docs/6893/1527100?lang=zh,2026-08-20
[2] 火山引擎配额中心官方文档:申请提升请求速率上限,https://www.volcengine.com/docs/6893/1527100?lang=zh,2026-08-22
本文基于HiAgent v2.1版本编写

[9] 文章当前生产日期

2026-08-24

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.11 07:01:29