EKS集群磁盘使用率监控:三类Datadog指标告警解析与适用场景
Amazon EKS集群磁盘使用率Datadog告警规则解析
规则1:(k8s) High Filesystem Usage Detected
k8s-high-filesystem-usage: name: "(k8s) High Filesystem Usage Detected" type: metric alert query: | avg(last_10m):avg:kubernetes.filesystem.usage_pct{*} by {cluster_name} > 90 message: | {{#is_warning}} {{cluster_name.name}} filesystem usage greater than 80% for 10 minutes {{/is_warning}} {{#is_alert}} {{cluster_name.name}} filesystem usage greater than 90% for 10 minutes {{/is_alert}}
指标含义
基于Kubernetes层面采集的kubernetes.filesystem.usage_pct指标,计算整个EKS集群过去10分钟的平均文件系统使用率,平均值超过90%触发告警,超过80%触发警告。该指标是将集群所有节点的文件系统使用率取平均后聚合到集群维度,反映集群整体的磁盘使用水平。
适用场景
- 用于集群级宏观监控,快速掌握整个集群的磁盘使用趋势;
- 不需要关注单个节点细节,只想了解集群整体是否面临磁盘资源压力时使用,比如运维日常巡检集群健康状态。
规则2:(k8s) High Disk Usage Detected
k8s-high-disk-usage: name: "(k8s) High Disk Usage Detected" type: metric alert query: | min(last_5m):min:kubelet.volume.stats.used_bytes{*} by {cluster_name} / avg:kubernetes.kubelet.volume.stats.capacity_bytes{*} by {cluster_name} * 100 > 90 message: | ({{cluster_name.name}} High disk usage detected
指标含义
通过Kubelet采集的kubelet.volume.stats.used_bytes(存储卷已用字节数)和kubelet.volume.stats.capacity_bytes(存储卷总容量字节数),计算集群所有持久化存储卷(PV/PVC)过去5分钟的整体使用率,占比超过90%触发告警。该指标聚焦于业务数据存储用的持久化卷,而非节点本地磁盘。
适用场景
- 当业务大量依赖持久化存储(如数据库、文件服务、数据缓存等)时,监控存储卷的整体负载;
- 避免因存储卷耗尽导致业务无法写入数据,适合关注业务存储资源状态的场景。
规则3:(k8s) High Disk Usage Detected
k8s-high-disk-usage: name: "(k8s) High Disk Usage Detected" type: metric alert query: | min(last_5m):min:system.disk.used{*} by {host,cluster_name} / avg:system.disk.total{*} by {host,cluster_name} * 100 > 90 message: | ({{cluster_name.name}} High disk usage detected on {{host.name}}
指标含义
基于节点操作系统层面采集的system.disk.used(节点已用磁盘字节数)和system.disk.total(节点总磁盘字节数),计算单个EKS节点过去5分钟的磁盘使用率,占比超过90%触发告警,且告警信息会明确指向具体节点。该指标精准到每台节点的本地磁盘使用情况。
适用场景
- 需要定位具体磁盘过载的节点时使用,比如排查节点因日志堆积、临时文件占用、容器镜像过多导致磁盘满的问题;
- 适合节点级精细化监控,方便运维人员快速定位故障节点并进行清理或扩容操作。
内容的提问来源于stack exchange,提问作者Kaumudi Gupta
相关产品推荐
相关产品推荐

