You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何监测AKS中API Server的存活状态?可用指标有哪些?

监测AKS环境中API Server存活状态的标准指标与方案

一、最直接的存活检测指标:up指标

Prometheus内置的up指标是检测API Server存活状态的标准方案,对应的查询语句为:

up{job="kube-apiserver"}
  • 结果为1:表示Prometheus能正常抓取到API Server的指标,服务存活;
  • 结果为0:表示Prometheus无法连接到API Server(比如服务宕机、网络不通),服务不可用。
    这个指标核心是检测Prometheus与API Server的连通性,是判断服务是否存活最可靠的标准。

二、关于apiserver_request_total指标的使用说明

你提到用apiserver_request_total(按请求动词、响应码等维度统计的请求计数器)计算失败请求占比来判断状态,这里需要明确:

  • 如果API Server完全宕机,Prometheus根本无法抓取到该指标,不会出现“所有请求均为失败”的情况——因为连指标采集请求都无法完成,该时间范围内不会有任何新的指标数据生成。
  • 这个指标适合用来监控API Server的请求健康度,比如正常运行时的失败请求占比。示例查询语句(计算最近5分钟非2XX请求占比):
sum(rate(apiserver_request_total{code=~"4..|5.."}[5m])) / sum(rate(apiserver_request_total[5m]))

当该值达到100%时,说明API Server虽然存活,但所有请求都处理失败,属于服务异常但未宕机的场景,需要单独告警。

三、K8s健康端点的实用性

K8s提供的/livez、/readyz等健康端点并非只能人工查看,它们完全支持程序化调用——很多监控工具都会通过这些端点做存活/就绪检测。不过对于Prometheus来说,up指标已经封装了对目标服务的可达性检测,通常不需要额外调用这些端点来判断存活状态。

内容的提问来源于stack exchange,提问作者bunny

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.16 05:22:39