EKS集群ALB关联CloudWatch指标选型:Grafana监控应用可用性
ALB健康监控指标推荐(EKS+Grafana+CloudWatch场景)
针对你的EKS Deployment(2副本)+ ALB的监控场景,结合CloudWatch数据源,推荐以下几个ALB相关的健康检查类指标,能精准感知单个副本的故障状态:
UnHealthyHostCount:直接统计目标组中不健康的实例数量。当你的2个副本中有1个故障时,这个指标会显示为1,能立刻发现有实例异常,弥补
HealthyHostCount仅显示汇总健康数的不足。在Grafana中配置时,记得按TargetGroup维度过滤,必要时可拆分到Target维度查看具体哪个实例不健康。HealthCheckFailedCount:统计ALB对目标组实例执行健康检查的失败次数。单个副本故障时,该实例对应的失败次数会持续累计。通过按
Target维度拆分指标,你能明确看到是哪个副本的健康检查频繁失败,方便定位问题。TargetResponseTime:虽然不是直接的健康检查指标,但可辅助判断实例状态。如果某个副本出现故障,健康检查的响应时间可能会骤升或超时(超过你配置的健康检查超时时间)。结合这个指标,能更早发现实例的异常趋势。
TargetConnectionErrorCount:记录ALB与目标实例建立连接时的错误次数。当副本故障导致无法正常连接时,这个指标会上升,可作为实例健康状态的补充判断依据。
额外提示:在Grafana中配置这些指标时,一定要开启维度拆分(比如按Target或InstanceId),不要只看目标组的汇总数据,这样才能精准定位到单个副本的故障。
内容的提问来源于stack exchange,提问作者Khalil Azennoud
相关产品推荐
相关产品推荐

