You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

已配置Prometheus实例宕机告警,如何添加node-exporter服务停止规则?

添加node-exporter服务停止的Prometheus告警规则

你可以直接在现有告警规则组中新增针对node-exporter的告警规则,具体操作如下:

1. 明确监控指标逻辑

node-exporter作为Prometheus的采集目标,会被生成up指标:

  • 服务正常运行时,up{job="node-exporter"}值为1
  • 服务停止/不可达时,该指标值为0

2. 修改告警规则配置

在你现有的Down规则组中新增一条规则,完整配置如下:

groups:
- name: Down
  rules:
  - alert: InstanceDown
    expr: up == 0
    for: 3m
    labels:
      severity: 'critical'
    annotations:
      summary: "Instance {{ $labels.instance }} is down"
      description: "{{ $labels.instance }} of job {{ $labels.job }} has been down for more than 3 minutes."
  - alert: NodeExporterDown
    expr: up{job="node-exporter"} == 0
    for: 2m  # 可根据业务需求调整告警延迟时间
    labels:
      severity: 'critical'
    annotations:
      summary: "Node-Exporter instance {{ $labels.instance }} is down"
      description: "Node-Exporter on {{ $labels.instance }} (job: {{ $labels.job }}) has been unavailable for more than 2 minutes."

关键配置说明:

  • expr:通过job="node-exporter"过滤指标,确保仅针对node-exporter服务触发告警(如果你的node-exporter job名称不是node-exporter,请替换为实际名称)
  • for:设置延迟告警时间,避免临时网络抖动导致误报
  • annotations:使用{{ $labels.instance }}和{{ $labels.job }}变量填充具体实例信息,让告警内容更直观

3. 让配置生效

修改完成后,需要重新加载Prometheus配置:

  • 方式1:向Prometheus进程发送SIGHUP信号:kill -HUP <prometheus进程ID>
  • 方式2:直接重启Prometheus服务

内容的提问来源于stack exchange,提问作者Amira Elsayed Ismail

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 07:45:49