如何配置需手动恢复、不自动解除告警的Datadog监控?
Datadog监控配置人工确认恢复方案
针对日志计数类监控触发后短窗口自动恢复、未等运维处置就同步关闭PagerDuty告警的问题,按以下步骤配置即可实现必须人工干预才能回到OK状态:
一、Datadog监控规则侧配置
- 进入目标监控的编辑页面,定位到**告警条件(Alert conditions)**配置区
- 关闭自动恢复开关:找到
Automatically resolve monitor相关配置项,直接取消勾选;如果当前版本没有独立取消开关,将自动恢复的等待时长设置为允许的最大值(9999小时),从规则层面禁止系统根据指标回落自动判定恢复 - 针对日志计数类规则单独调整恢复阈值:不要使用默认的「统计窗口内日志数低于触发阈值即恢复」的逻辑,将恢复判定的日志计数阈值设为-1(永远无法自然满足的数值),或把恢复判定的时间窗口设为0,彻底切断指标正常时的自动恢复触发路径
- 配置恢复权限:在通知配置区块找到「监控解决权限」选项,勾选
仅拥有该监控编辑权限的用户可解决告警,避免无关人员误关闭告警 - 批量修改场景可直接调用Datadog API更新监控配置,将监控
options字段中的auto_resolve参数设为false,无需逐个手动编辑规则
二、PagerDuty联动侧配置
- 找到Datadog对接的PagerDuty服务,进入服务的告警行为设置页
- 取消勾选
Datadog发送恢复信号时自动解决事件选项,避免Datadog异常触发恢复信号时自动关闭PagerDuty工单 - 新增服务级规则:所有来自该Datadog集成的告警,禁止任何自动解决动作,仅当运维人员手动标记事件为已解决时,才将解决状态同步回Datadog
三、配置验证
配置完成后做两轮校验即可确认生效:
- 模拟触发测试告警,等待超过2倍原监控统计窗口的时长,确认Datadog监控仍保持告警状态、PagerDuty事件未自动关闭
- 手动在Datadog侧点击解决告警,确认PagerDuty事件同步更新为已解决状态,双向联动正常
提示:配置完成后建议给这类需人工确认的监控打上统一标签,后续做告警统计、值班排班时可以单独筛选这类高优先级告警,避免和普通自动恢复的告警混在一起。
内容的提问来源于stack exchange,提问作者Marisa
相关产品推荐
相关产品推荐

