如何修改Datadog监控查询统计30分钟内阈值违规次数并触发告警?
解决Datadog Hazelcast Put延迟阈值违规次数统计问题
要统计最近30分钟内延迟突破10000ms的次数,并在次数≥4时触发告警,你需要将原查询转换为统计布尔结果的计数逻辑,具体修改如下:
修改后的查询
sum(last_30m):count(avg(last_10m):sum:hazelcast.imap.local_total_put_latency{env:dev,name:initMap,service:myService} by {host} / sum:hazelcast.imap.local_put_operation_count{env:dev,name:initMap,service:myservice} by {host} > 10000) by {host}
逻辑说明
- 保留延迟判断逻辑:原查询的
avg(last_10m):sum:... / sum:... > 10000部分会返回1(表示延迟超过阈值,违规)或0(合规) - 统计违规次数:用
count()函数统计最近30分钟(last_30m)内上述结果为1的次数,覆盖你需要的时间范围 - 按主机聚合:外层的
sum和by {host}保证每个主机的违规次数被单独统计
告警规则配置
在Datadog告警设置中:
- 将阈值设置为
>=4 - 时间窗口选择「最近30分钟」,确保告警触发逻辑与统计范围匹配
内容的提问来源于stack exchange,提问作者Lopside
相关产品推荐
相关产品推荐

