Flink 1.14响应式扩缩容场景下Latency监控指标缺失问题咨询
Flink 1.14 配置延迟指标后Prometheus无法查询到对应直方图指标
我正在参考Flink官方教程搭建响应式扩缩容能力,希望了解工作节点数量快速变化对整体端到端延迟的影响。按照Flink 1.14官方文档指引,我已在配置映射中添加了metrics.latency.interval: 1000配置项,按理解系统会每秒发送延迟标记生成对应的延迟指标,但我在Prometheus中无法找到对应的直方图指标,目前可查询到的延迟相关指标如下图所示:
我当前使用的版本为Flink 1.14,请问是否遗漏了相关配置或操作?
解决方案
你需要补充以下配置和检查项即可正常获取到对应的延迟直方图指标:
- 补充直方图样本保留配置
Flink默认不会生成延迟直方图统计,必须额外配置metrics.latency.history-size参数,该参数默认值为0,代表不保留延迟样本、不生成直方图数据。你可以根据统计需求设置为大于0的数值,比如设置为metrics.latency.history-size: 120即可保留120个样本生成直方图。 - 检查Prometheus reporter配置是否完整
确认你的Flink配置中已经正确配置了Prometheus导出相关参数,示例配置如下:metrics.reporter.prom.class: org.apache.flink.metrics.prometheus.PrometheusReporter metrics.reporter.prom.port: 9249-9250 - 确认延迟追踪开关未被关闭
检查是否存在pipeline.latency-tracking.enabled: false配置,该配置优先级高于metrics.latency.interval,默认值为true,若手动修改为false需要改回true才能正常生成延迟标记。 - 指标查询确认
配置生效并重启作业后,你可以在Prometheus中查询flink_taskmanager_job_latency前缀的直方图指标,指标会携带源算子、目标算子、作业ID等维度标签。
内容的提问来源于stack exchange,提问作者Hegemon
相关产品推荐
相关产品推荐

