如何配置Prometheus告警规则实现近24小时文件总数不足告警?
Prometheus告警规则配置示例
针对你需求的/etc/prometheus/alert.rules.yml配置如下:
groups: - name: file_monitoring_alerts rules: - alert: LowFileCreationTotal expr: sum_over_time(file_count_RAN_RRC{folder="RAN_RRC", instance="jobserver:9669", job="files_monitor"}[24h]) < 1000 for: 5m # 可选:等待5分钟确认告警持续触发,避免误报 labels: severity: warning annotations: summary: "近24小时RAN_RRC文件夹文件创建总数不足" description: "近24小时内,RAN_RRC文件夹累计创建文件数为{{ $value }},低于阈值1000。"
关键说明:
sum_over_time函数:用于计算指定时间范围内(这里是24小时)所有样本值的总和,正好匹配你统计近24小时文件总数的需求。因为你的指标每小时生成一个独立值,sum_over_time[24h]会自动累加这24个小时的样本。for字段:设置为5分钟是为了避免瞬时波动导致的误告警,你可以根据实际场景调整或直接设为0m移除等待逻辑。- 标签与注释:
severity标签用于区分告警级别,annotations里的内容会同步到Slack通知中,帮助运维人员快速定位问题详情。
配置完成后重启Prometheus服务使规则生效,同时确保AlertManager已正确配置Slack通知渠道(该部分需在AlertManager独立配置文件中完成,不属于当前告警规则范畴)。
内容的提问来源于stack exchange,提问作者nidooooz
相关产品推荐
相关产品推荐

