Flink1.10.2版本Grafana中flink_taskmanager_Status_JVM_CPU_Load指标异常排查
问题解答
1. Flink 1.10.2 CPU指标准确性
Flink 1.10.2版本官方内置的JVM CPU负载指标没有已知的普遍性上报错误问题,你观测到的Job Manager CPU使用率低是正常现象:Job Manager的核心职责是任务调度、状态管理协调、指标收集上报,本身不执行业务计算逻辑,你的任务并行度仅为1,所有消费、处理逻辑都运行在Task Manager进程上,Job Manager无业务开销,CPU负载自然偏低。
2. PromQL配置问题
你当前使用的PromQL语法没有错误,但是查询的对象不符合你的需求:
flink_jobmanager_Status_JVM_CPU_Load{exported_job='${jobmanager_prome_job}'}
上述语句仅查询Job Manager进程的JVM CPU占用,如果你要观测业务任务的实际CPU消耗,需要替换为Task Manager的CPU指标查询语句:
flink_taskmanager_Status_JVM_CPU_Load{exported_job='${jobmanager_prome_job}'}
补充验证建议
- 5000条/秒的Kafka消费速率本身压力极低,如果你没有配置复杂的计算逻辑(如多流关联、大窗口计算、正则字段解析等),哪怕是Task Manager的CPU使用率偏低也属于正常情况。
- 如果担心指标上报异常,可以直接登录部署节点,通过
top、ps等系统命令直接查看Flink进程的实际CPU占用,和Prometheus上报的指标做对比即可验证准确性。
内容的提问来源于stack exchange,提问作者CharlieIsAwesome
相关产品推荐
相关产品推荐

