如何配置DataDog告警:仅在服务器连续两个10分钟周期下线时触发
DataDog 连续双10分钟周期下线告警配置方案
核心逻辑
要实现“连续两个10分钟周期内均存在服务器下线行为”才触发告警,需要同时验证当前10分钟窗口和前一个10分钟窗口的指标最小值均为0(min=0意味着该窗口内至少出现一次下线)。
具体配置步骤
- 进入DataDog监控页面,创建新的「Metric Alert」(或编辑现有告警规则)
- 在指标查询区域添加两个独立的查询:
- 查询1(验证前10分钟周期):
这里的min(last_10m):min:your.metric.name{host:目标服务器标识} offset 10moffset 10m用于获取过去10-20分钟这个窗口的指标最小值,对应第一个10分钟周期 - 查询2(验证当前10分钟周期):
这个查询直接获取过去0-10分钟窗口的指标最小值,对应第二个10分钟周期min(last_10m):min:your.metric.name{host:目标服务器标识}
- 查询1(验证前10分钟周期):
- 配置告警条件:
- 选择「复合条件(Composite Condition)」
- 设置判断逻辑为:
(查询1的结果 == 0) AND (查询2的结果 == 0) - 评估窗口保持为10分钟,确保每个周期的状态判断独立有效
- 通知与恢复设置:
- 触发告警的条件保持默认的“当复合条件满足时”即可,无需额外延长持续时间(复合逻辑已包含连续两个周期的判断)
- 恢复通知可设置为当任意一个查询的结果回到1时触发,确保服务器恢复后及时解除告警
关键说明
offset参数是实现跨周期验证的核心,它让你能调取前一个时间窗口的计算结果- 确保
your.metric.name和host标签与你实际上报的指标、服务器标识完全匹配 - 测试场景建议:
- 模拟服务器连续下线20分钟:应触发告警
- 模拟服务器下线5分钟后恢复:两个周期中只有一个满足min=0,不会触发告警
内容的提问来源于stack exchange,提问作者Arsha
相关产品推荐
相关产品推荐

