Grafana进程CPU使用率查询失效问题排查(Prometheus/Windows Exporter)
Grafana进程指标查询失效排查思路(Windows Exporter+Prometheus)
针对「Grafana中无法显示Windows Exporter进程指标,但Prometheus本地查询正常、常规CPU/内存指标正常」的问题,可按以下步骤排查:
1. 核对Grafana Prometheus数据源细节
- 检查查询超时设置:进程指标的聚合查询(如
rate+sum)计算量较大,若Grafana数据源超时时间过短,可能导致查询被截断。进入数据源配置页面,调整Query timeout参数(比如从默认30秒延长至60秒)。 - 确认访问模式与网络连通性:若数据源使用
Server模式(Grafana服务器主动请求Prometheus),检查Grafana服务器IP是否在Prometheus的访问白名单中;即使常规指标能查询,也可能存在进程指标请求的特殊限制。 - 校验指标名称拼写:确保Grafana查询中的
windows_process_cpu_time_total、process标签与Prometheus中的完全一致(含大小写、下划线),部分场景下Grafana查询编辑器对大小写敏感。
2. 在Grafana Explore界面做基础测试
- 直接输入最简进程指标查询(如
windows_process_cpu_time_total{process="OpcUaLauncher"}),跳过sum/rate聚合,验证是否能返回原始时间序列数据,排除聚合函数的影响。 - 查看Grafana查询错误日志:在Grafana日志文件(Linux默认路径
/var/log/grafana/grafana.log,Windows可通过事件查看器查找)中搜索与进程指标查询相关的错误,排查是否存在权限限制、响应解析失败等问题。
3. 检查Prometheus数据与配置
- 确认数据保留时间:若Grafana查询的时间范围超出Prometheus的
storage.tsdb.retention.time配置,会导致无数据返回。核对Prometheus配置文件中的保留时长,调整Grafana查询的时间范围至保留期内。 - 排查Relabel规则:检查Prometheus的
scrape_configs中是否存在relabel规则,是否误删除了process标签或整个进程指标序列。 - 尝试绝对时间范围查询:在Grafana中选择固定的短时间范围(如最近1小时),替代相对时间(如「最近5分钟」),排除时间范围计算异常的可能。
4. 验证Windows Exporter状态
- 确认进程采集模块加载状态:查看Windows Exporter的运行日志,确认
process模块已正常加载,无采集权限或进程枚举错误。 - 检查Exporter运行账户权限:若Exporter运行账户的权限被调整,可能影响进程指标采集,但此场景下Prometheus本地也会无数据,可作为兜底排查项。
5. 其他兜底排查动作
- 清除Grafana缓存:进入Grafana的「Configuration > Data sources」页面,点击数据源的「Clear cache」按钮,或重启Grafana服务,避免旧缓存导致的查询异常。
- 核对版本兼容性:若近期升级过Grafana或Prometheus,确认两者版本是否兼容,部分版本迭代可能导致API解析逻辑变化。
内容的提问来源于stack exchange,提问作者Kaasper
相关产品推荐
相关产品推荐

