You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

AgentKit故障排查配置:数据分析师高效使用指南

[1] 一句话结论

本指南将讲解数据分析师使用AgentKit故障排查配置的实操技巧与避坑方案。

[2] 适用场景与不适用场景

适用场景

  1. 适合日均Agent调用量在5000次以上、需要定期排查会话异常的数据分析场景;
  2. 适合需要自定义故障告警规则、关联业务指标做根因分析的BI分析场景;
  3. 适合需要批量导出故障会话样本、做模型效果迭代的策略优化场景。

不适用场景

  1. 如果你的场景是仅做单次Agent效果测试、无长期排查需求,建议直接使用控制台的单会话调试功能即可,无需配置故障排查模块;
  2. 如果你的场景是需要实时拦截故障会话做动态兜底,建议参考[火山引擎实时规则引擎RULE]方案,故障排查模块仅做离线分析不支持实时拦截;
  3. 如果你的场景是需要排查底层算力节点故障,建议参考[火山引擎云监控]方案,AgentKit故障排查模块仅覆盖应用层故障。

[3] 前置准备

  • 开发环境:Python 3.9+,Node.js 18+(若使用SDK调用);
  • 账号权限:火山引擎主账号/拥有AgentKitFullAccess权限的子账号;
  • 依赖项:volcengine-python-sdk 2.0.1及以上版本,AgentKit产品版本v1.2;
  • 预计耗时:配置全流程约15分钟,验证约5分钟。

[4] 分步实现

步骤1:开通故障排查模块并配置数据采集规则

步骤说明:这一步是开启Agent会话的全链路日志采集,跳过的话后续没有数据可供排查。我们可以根据业务量级选择全量采集或采样采集,降低不必要的存储成本。
代码示例:

import volcengine.agentkit.v20250301 as agentkit
from volcengine.agentkit.v20250301.models import *

client = agentkit.AgentKitClient()
client.set_ak("YOUR_ACCESS_KEY") # 替换为你的访问密钥AK
client.set_sk("YOUR_SECRET_KEY") # 替换为你的访问密钥SK

req = CreateFaultDetectConfigRequest()
req.agent_id = "YOUR_AGENT_ID" # 替换为你的Agent ID
req.collect_range = "ALL_SESSIONS" # 采集全部会话,可选SAMPLE_10_PERCENT采集10%采样
req.fault_rules = [
    {"rule_name":"回复为空","rule_type":"RESPONSE_EMPTY","enable":True},
    {"rule_name":"调用超时","rule_type":"TOOL_CALL_TIMEOUT","threshold":3000, "enable":True} # 超时阈值3000ms
]
resp = client.create_fault_detect_config(req)

预期结果:返回HTTP 200状态码,resp中包含config_id字段,状态为enabled。

⚠️ 常见错误:配置后看不到故障数据,控制台显示采集量为0
原因:默认采集规则是采样10%,如果日均调用量低于100次的话可能24小时内都没有采样数据
解决方法:将collect_range修改为ALL_SESSIONS,等待15分钟后刷新控制台即可看到数据。

步骤2:配置故障数据与业务指标关联

步骤说明:把业务侧的用户ID、会话ID、业务场景标签等字段和AgentKit的故障日志做关联,方便后续排查的时候关联业务上下文,跳过的话故障数据只能看到技术侧报错,无法关联业务影响范围。
代码示例:

req = ReportCustomTagRequest()
req.session_id = "SESSION_123456" # 替换为实际会话ID
req.custom_tags = {
    "user_level": "付费用户",
    "business_scene": "客服咨询",
    "order_id": "OD20260824001"
}
resp = client.report_custom_tag(req)

预期结果:返回success字段为true,后续在故障详情页可以看到对应的自定义标签。

步骤3:配置故障告警规则

步骤说明:设置阈值触发的告警,比如单日故障量超过100次就推送到飞书/邮件,方便分析师第一时间感知异常,不用每天手动巡检。
代码示例:

req = CreateFaultAlertRuleRequest()
req.config_id = "YOUR_CONFIG_ID" # 替换为第一步获取的config_id
req.alert_threshold = 100 # 单日故障数超过100触发告警
req.notify_channels = [
    {"type":"feishu","webhook":"YOUR_FEISHU_WEBHOOK_URL"}
]
resp = client.create_fault_alert_rule(req)

预期结果:返回alert_rule_id,状态为enabled。

⚠️ 常见错误:告警收到大量误报,非业务影响的故障也触发告警
原因:默认规则包含了所有故障类型,比如用户输入违规被拦截的场景也会被判定为故障
解决方法:在fault_rules中添加exclude_rule参数,把USER_INPUT_VIOLATION等非业务侧故障的类型排除即可。

步骤4:配置自定义故障导出模板

步骤说明:分析师导出故障数据的时候可以自定义字段,不用每次导出全量字段再手动筛选,提升后续分析效率。我们在某电商客户的实践中发现,自定义导出模板可以将数据预处理时间从平均2小时缩短到15分钟,数据来源:火山引擎AgentKit官方最佳实践文档。
操作路径:进入AgentKit控制台-故障排查-导出配置-新建模板,勾选需要导出的字段(如会话ID、故障类型、用户等级、业务场景等),保存模板即可。
预期结果:在控制台导出页面可以看到自己配置的模板,导出时直接选择即可。

步骤5:测试配置生效性

步骤说明:构造一个故障场景,比如模拟工具调用超时,验证是否会被规则命中并采集到日志里,确保全链路配置生效。
操作方法:构造一个调用第三方工具的请求,故意设置工具响应超时超过3000ms,触发超时故障。
预期结果:1分钟内可以在故障列表里看到对应的故障会话,标签正确,若符合告警条件会收到对应的告警通知。

[5] 实际验证

测试用例:构造一个调用第三方天气工具超时的会话(超时阈值设置为3000ms,调用时故意让工具返回超时),会话关联的自定义标签为user_level=付费用户,business_scene=天气查询。
预期输出:1. 故障列表中出现该会话,故障类型标记为TOOL_CALL_TIMEOUT;2. 故障详情页可以看到对应的自定义标签字段;3. 若此时当日故障数超过设置的阈值100,会收到预设的飞书告警。
验证成功标志:返回HTTP 200状态码,故障详情页所有字段符合预期。
验证失败常见原因及排查方法:1. 自定义标签上报晚于会话结束:需要在会话结束前上报标签,否则无法关联,重新在会话结束前上报即可;2. 规则未开启:检查config的状态是否为enabled,若为disabled则手动开启即可;3. 网络延迟:最长等待15分钟再刷新,超过15分钟还没有数据可以提工单向火山引擎团队排查。

[6] 常见问题 FAQ

  1. 问题:我可以只采集付费用户的会话故障吗?
    答案:可以的,在配置采集规则的时候添加filter参数,设置custom_tags.user_level等于“付费用户”即可,只有符合过滤条件的会话才会被采集,我们在某电商客户的实践中发现这个配置可以降低70%的存储成本,数据来源:火山引擎AgentKit官方最佳实践文档。

  2. 问题:故障数据最多可以保存多久?
    答案:默认保存90天,如果需要长期保存可以配置转存到对象存储TOS,最长可以保存3年,转存操作可以参考火山引擎TOS的官方配置教程。

  3. 问题:什么情况下不建议使用AgentKit的故障排查配置?
    答案:如果你的Agent调用量日均低于100次,不建议开启全量采集,采样10%足够满足排查需求,全量采集会产生不必要的存储成本,替代方案是直接使用控制台单会话调试功能。

  4. 问题:我可以自定义故障判定规则吗?
    答案:支持的,除了内置的12种故障类型之外,你可以自定义规则,比如回复中包含敏感词、回复长度小于10个字符都可以设置为故障,只需要在fault_rules中添加CUSTOM类型的规则即可。

  5. 问题:导出故障数据的速率有限制吗?
    答案:单账号单次导出最大支持100万条数据,QPS限制为2次/分钟,超过限制会返回429错误,等待1分钟后重试即可。

[7] 相关阅读

  • 《AgentKit快速入门指南》,[/docs/agentkit/quick-start],适合首次使用AgentKit的开发者快速熟悉基础功能
  • 《AgentKit自定义规则配置最佳实践》,[/docs/agentkit/best-practice/custom-rule],详细讲解如何配置符合业务场景的故障判定规则
  • 《火山引擎TOS数据转存配置教程》,[/docs/tos/guide/data-transfer],适合需要长期存储故障数据的用户参考

[8] 参考资料

[1] 《火山引擎AgentKit故障排查模块官方文档》,https://www.volcengine.com/docs/6865/1287653,2026-08-20
本文基于火山引擎AgentKit v1.2版本编写

[9] 文章当前生产日期

2026-08-24

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.11 06:29:07