求可分别统计Readiness与Liveness探针失败次数的Thanos PromQL
解决方案
要分别统计Liveness和Readiness探针的失败次数,可以利用kube-state-metrics暴露的kube_pod_container_status_probe_failure_total指标,该指标自带probe标签区分探针类型,正好匹配你的需求。
1. 累计失败总次数统计
- Liveness探针累计失败次数:
sum by (namespace, pod, container) (kube_pod_container_status_probe_failure_total{probe="liveness"}) - Readiness探针累计失败次数:
sum by (namespace, pod, container) (kube_pod_container_status_probe_failure_total{probe="readiness"})
2. 指定时间段内的失败次数统计(示例:最近1小时)
如果需要统计某段时间内新增的失败次数,使用increase()函数即可:
- 最近1小时Liveness探针失败次数:
sum by (namespace, pod, container) (increase(kube_pod_container_status_probe_failure_total{probe="liveness"}[1h])) - 最近1小时Readiness探针失败次数:
sum by (namespace, pod, container) (increase(kube_pod_container_status_probe_failure_total{probe="readiness"}[1h]))
补充说明
kube_pod_container_status_ready仅用于标识容器当前是否处于就绪状态(值为1表示就绪,0表示未就绪),无法直接统计探针失败次数,仅可作为探针失败后的状态参考项。- 若Thanos数据源中未找到
kube_pod_container_status_probe_failure_total指标,需检查集群内kube-state-metrics的部署状态,确认未被配置禁用该指标采集(默认kube-state-metrics会暴露此指标)。
内容的提问来源于stack exchange,提问作者Soumik Laik
相关产品推荐
相关产品推荐

