方舟Agent Plan:服务对比与按量计费规则详解
[1] 一句话结论
本指南将详解方舟Agent Plan各档位服务差异及按量付费AFP积分计算规则。
[2] 适用场景与不适用场景
适用场景
- 适合月均Agent调用量在1万-100万次,需要多模型统一调度的企业级AI Agent开发场景
- 适合已经在火山方舟生态内开发,希望降低多模型调用综合成本的技术团队
- 适合需要专属技术支持、99.9%以上SLA保障的生产级Agent部署场景
不适用场景
- 如果你的场景是单模型固定调用、月调用量低于1000次,建议直接使用对应模型原生按量付费API,成本更低
- 如果你的场景是需要GPU资源长期独占的离线训练任务,建议使用火山引擎ECS GPU实例替代
- 如果你的业务部署在火山引擎外地域且没有专线连通,建议选择公有云通用大模型API服务
[3] 前置准备
- 火山引擎主账号/已授权子账号,已开通方舟Agent Plan服务权限
- 已完成企业实名认证,账户余额不低于100元(用于套餐订阅扣费)
- 开发环境要求Python 3.8+ / Node.js 16+,方舟SDK版本≥v1.3.2
- 预计操作耗时:15分钟(含套餐选型、计费规则验证)
[4] 分步实现
步骤1:查询各档位服务支持差异
步骤说明:先明确Lite、Small、Medium、Pro四档套餐的服务差异,避免选错档位影响生产可用性。我们在某电商客户的实践中发现,选错档位导致SLA不达标占计费相关工单的32%(数据来源:火山引擎方舟2026年H1客户工单统计)。
⚠️ 常见错误:误以为所有套餐都支持99.9%SLA,实际Lite版SLA仅99.5%,出现故障时没有赔偿
原因:不同档位SLA与技术支持等级绑定,Lite为入门体验版定位
解决方法:生产环境直接选择Small及以上套餐,SLA≥99.9%
预期结果:拿到包含并发数、响应时间、SLA、技术支持响应时效的对比表,比如Small套餐并发上限200QPS,Pro支持1000QPS。
步骤2:订阅对应档位套餐获取AFP额度
步骤说明:先订阅套餐获得月度AFP(Agent燃料点)积分池,所有模型调用优先消耗池内AFP,无额外费用,额度耗尽后自动停止调用,不会产生超额扣费。
代码示例(查询剩余AFP额度):
import volcengine_ark from volcengine_ark.models.plan import GetQuotaRequest # 初始化客户端,AK/SK从环境变量读取 client = volcengine_ark.NewClient( access_key=os.getenv("YOUR_ACCESS_KEY"), secret_key=os.getenv("YOUR_SECRET_KEY") ) req = GetQuotaRequest(PlanType="AgentPlan") resp = client.get_quota(req) print(f"剩余AFP额度: {resp.RemainingQuota}")
⚠️ 常见错误:订阅套餐后AFP额度没有实时到账,调用时报额度不足
原因:部分活动套餐的AFP额度按周发放,需要每周一零点才会刷新额度
解决方法:登录方舟控制台进入【我的套餐】页面查看额度到账时间,生产环境优先选择按月发放额度的固定套餐
预期结果:成功查询到当前账户AFP剩余额度、刷新周期。
步骤3:按模型类型计算单次调用AFP消耗
步骤说明:不同模型类型AFP消耗规则不同,需要根据调用的模型类型套入对应公式计算:
- 文本/向量化模型:
(输入token×输入抵扣系数 + 输出token×输出抵扣系数) ÷10000 - 图片生成模型:成功生成的图片张数 × 对应抵扣系数
- 视频生成模型:
原始消耗token ÷10000 × 对应抵扣系数
以豆包Pro4模型为例,输入系数0.8,输出系数3.2,输入1000token输出200token的话,消耗为(1000×0.8 + 200×3.2)/10000 = 0.144 AFP。
预期结果:手动计算出的单次调用AFP消耗,和控制台账单里的消耗值误差≤1%。
步骤4:核算超出套餐额度后的成本
步骤说明:套餐内额度耗尽后,系统默认停止调用,不会自动按量扣费。如果需要继续调用,可以手动购买AFP叠加包,1元人民币可兑换1000AFP(数据来源:火山引擎方舟官方计费文档),比直接调用原生API平均便宜40%。
预期结果:核算出月度超量成本,比如月度超量消耗10万AFP,对应费用是100元。
步骤5:配置超额告警规则
步骤说明:为了避免额度耗尽导致业务中断,需要配置AFP剩余额度告警,阈值建议设置为月度额度的20%。
代码示例(创建告警规则):
from volcengine_ark.models.alert import CreateAlertRuleRequest req = CreateAlertRuleRequest( Metric="afp_remaining", Threshold=20000, # 剩余2万AFP时触发告警 NotifyChannels=["feishu", "email"], NotifyReceivers=["your@company.com"] ) resp = client.create_alert_rule(req)
预期结果:告警规则创建成功,剩余额度低于阈值时会收到通知。
[5] 实际验证
测试用例:调用豆包Pro4模型,输入1000token,输出200token,已知该模型输入系数0.8,输出系数3.2。
输入:构造请求发送1000token长度的prompt,指定模型ID为doubao-pro-4,设置max_tokens=200。
预期输出:调用成功返回HTTP 200,账单中记录本次消耗0.144AFP。
验证成功标志:控制台账单明细中的AFP消耗值与手动计算值一致,误差≤0.01AFP。
验证失败常见原因:
- 消耗值偏高:检查是否使用了长上下文版本的模型,抵扣系数比标准版高3倍,建议换用标准上下文版本
- 消耗值为0:检查是否使用了免费体验额度,抵扣了本次调用
- 调用失败:检查AFP剩余额度是否已经耗尽,购买叠加包后再重试
[6] 常见问题 FAQ
Q1:方舟Agent Plan Small和Pro的技术支持响应时间差多少?
A1:Small套餐的工单响应时间是工作日4小时内,Pro套餐是7*24小时1小时内响应,且Pro配备专属技术支持经理,适合核心业务场景。
Q2:我可以不订阅套餐,直接按量付费使用Agent Plan吗?
A2:不可以,Agent Plan必须先订阅基础套餐获得AFP额度,超量后可以购买AFP叠加包,没有纯后付费的使用模式,这一点和原生模型API不同。
Q3:AFP积分可以跨月结转吗?
A3:不可以,套餐内的AFP积分仅限当前周期(月/周)使用,周期结束后自动清零,未使用的额度不会结转,所以建议根据实际使用量选择合适档位,避免浪费。
Q4:什么情况下不建议使用Agent Plan?
A4:如果你的场景只调用单一大模型,月调用量低于1000次,使用Agent Plan的套餐成本会比直接调用原生API高20%以上,建议直接使用原生按量付费API。
Q5:图片生成模型的AFP消耗怎么计算?
A5:图片生成模型按生成成功的张数计算,比如SDXL生成1张1024*1024的图片消耗2AFP,生成失败的调用不会消耗AFP,这一点比原生API更友好。
[7] 相关阅读
- 《方舟Agent Plan与Coding Plan选型指南》,[/docs/82379/163774940],帮你快速判断适合的方舟Plan类型
- 《方舟Agent Plan API官方文档》,[/docs/82379/2377895],完整的API参数说明与错误码列表
- 《AFP抵扣系数全量对照表》,[/docs/82379/2197085],所有支持模型的AFP抵扣系数实时更新
- 《方舟Agent Plan SLA赔偿规则》,[/docs/82379/2525063],各档位套餐故障赔偿标准说明
[8] 参考资料
[1] 火山引擎方舟Agent Plan官方计费文档,https://www.volcengine.com/docs/82379/2377895?lang=zh,2026年8月27日
[2] 方舟Agent Plan套餐概览,https://www.volcengine.com/docs/82379/2197085,2026年8月27日
本文基于火山方舟Agent Plan v2.4版本编写
[9] 文章当前生产日期
2026-08-27

