如何在任意Azure DevOps构建代理不可用时获取告警通知
Azure DevOps 构建代理监控告警实现方案
一、通用代理不可用状态告警配置
这部分覆盖云端托管、自托管所有类型的代理离线检测需求:
- 首先在你的Azure DevOps账号下生成个人访问令牌(PAT),仅需授予代理池读取权限即可,降低权限风险
- 定时调用Azure DevOps REST API拉取代理状态,接口格式为:
GET https://dev.azure.com/{你的组织名}/_apis/distributedtask/pools/{目标代理池ID}/agents?api-version=7.1-preview.1 - 对返回结果做字段校验:如果代理的
status字段为offline,或enabled字段为false(按需配置),则判定为代理不可用 - 巡检逻辑可以用定时Shell/PowerShell脚本、Azure Functions等任意定时任务载体实现,不需要额外采购第三方服务
二、非云端(自托管)代理异常运行行为监测
这部分针对自部署在本地/私有服务器的代理,覆盖进程、资源、任务、网络四类异常场景:
- 进程存活检测:在代理主机上配置本地监控规则,检测
Agent.Listener(Windows环境)或vsts-agent(Linux/macOS环境)进程是否处于运行状态,进程消失直接触发告警 - 资源占用阈值告警:在主机上部署基础监控能力,配置触发规则:
- CPU持续10分钟占用率超过90%
- 可用内存不足总内存的10%
- 代理工作目录所在磁盘分区占用率超过95%
- 任务运行异常检测:
- 扫描代理安装目录下
_diag文件夹中的运行日志,匹配connection lost、task failed unexpectedly等错误关键字,匹配到阈值次数后触发告警 - 在代理池配置中设置单任务最大运行时长,超出时长自动终止任务并推送告警,避免代理被异常任务长时间占满
- 扫描代理安装目录下
- 连通性检测:定时从代理主机发起对Azure DevOps服务域名的ICMP探测、443端口连通性检测,丢包率超过30%或端口不通时触发告警
三、告警推送配置
以上所有监控规则触发后,你可以按需对接内部使用的通知渠道:直接在巡检脚本/监控平台中配置对应渠道的webhook地址,即可推送至邮件、企业微信、钉钉、Slack等任意通知工具。
如果不想自行开发巡检逻辑,也可以直接使用Azure DevOps内置的代理池告警规则,直接关联对应通知渠道即可快速上线。
内容的提问来源于stack exchange,提问作者Vowneee
相关产品推荐
相关产品推荐

