已配置Prometheus实例宕机告警,如何添加node-exporter服务停止规则?
添加node-exporter服务停止的Prometheus告警规则
你可以直接在现有告警规则组中新增针对node-exporter的告警规则,具体操作如下:
1. 明确监控指标逻辑
node-exporter作为Prometheus的采集目标,会被生成up指标:
- 服务正常运行时,
up{job="node-exporter"}值为1 - 服务停止/不可达时,该指标值为
0
2. 修改告警规则配置
在你现有的Down规则组中新增一条规则,完整配置如下:
groups: - name: Down rules: - alert: InstanceDown expr: up == 0 for: 3m labels: severity: 'critical' annotations: summary: "Instance {{ $labels.instance }} is down" description: "{{ $labels.instance }} of job {{ $labels.job }} has been down for more than 3 minutes." - alert: NodeExporterDown expr: up{job="node-exporter"} == 0 for: 2m # 可根据业务需求调整告警延迟时间 labels: severity: 'critical' annotations: summary: "Node-Exporter instance {{ $labels.instance }} is down" description: "Node-Exporter on {{ $labels.instance }} (job: {{ $labels.job }}) has been unavailable for more than 2 minutes."
关键配置说明:
expr:通过job="node-exporter"过滤指标,确保仅针对node-exporter服务触发告警(如果你的node-exporter job名称不是node-exporter,请替换为实际名称)for:设置延迟告警时间,避免临时网络抖动导致误报annotations:使用{{ $labels.instance }}和{{ $labels.job }}变量填充具体实例信息,让告警内容更直观
3. 让配置生效
修改完成后,需要重新加载Prometheus配置:
- 方式1:向Prometheus进程发送SIGHUP信号:
kill -HUP <prometheus进程ID> - 方式2:直接重启Prometheus服务
内容的提问来源于stack exchange,提问作者Amira Elsayed Ismail
相关产品推荐
相关产品推荐

