Prometheus中app_events_total计数器时间范围统计异常求助
计数器异常计数问题排查与解决
可能原因及对应解决方法
计数器重置导致错误计算
Prometheus计数器在进程重启、配置变更时会重置为0,increase()对频繁重置的场景处理容易出问题。换成rate()乘以时间范围计算更稳定:sum(rate(app_events_total[$__range]) * $__range_seconds) by (event)$__range_seconds是Grafana内置变量,对应所选时间范围的秒数,能精准算出时段内总事件数。时间范围选错或数据时间偏移
检查Grafana的时间范围选择,是不是误选了包含历史事件的时段;同时确认数据源时间戳是否正确,有没有出现时间错位的情况。保留有实际增量的事件
如果某些事件在当前时段确实没发生,加过滤条件只留增量大于0的结果,避免饼图出现无效切片:sum(rate(app_events_total[$__range]) * $__range_seconds) by (event) > 0重复采集导致计数叠加
排查监控采集配置,是不是多个任务重复采集了同一个实例的指标。可以先去掉sum(),用increase(app_events_total[$__range]) by (event, instance)查看每个实例的计数,确认是否有重复数据。异常标签值导致的脏数据
检查event标签有没有脏数据(比如空值、错误枚举值),这些可能是代码错误上报的无效事件,看起来像大量计数但实际无效。用count(app_events_total) by (event)可以查看所有事件类型,排查异常标签。
内容的提问来源于stack exchange,提问作者secondbreakfast
相关产品推荐
相关产品推荐

