在Datadog中读取Flink延迟跟踪指标相关问题咨询
问题1:如何查询已启用的延迟指标名称列表,UI中找不到的原因
- 你配置的
metrics.latency.interval: 60000代表延迟标记每60秒生成一次,作业启动后需要至少等待1分钟才会生成对应的延迟指标,刚启动时看不到属于正常情况。 - 指标在Flink UI中的查看路径:进入对应运行中作业的详情页 → 点击任意算子 → 右侧指标面板中搜索
latency开头的指标即可。由于你配置的粒度是operator,每个算子下都会生成对应的延迟指标,格式为latency.<source算子ID>.<子任务索引>.<统计维度>,包含max、min、mean、p50、p95、p99等常见统计维度。 - 你也可以通过Flink REST API查询全量指标列表,调用接口
http://<JobManager地址>:<端口>/jobs/<作业ID>/metrics,过滤返回结果中包含latency的字段即可拿到完整的延迟指标列表。 - 如果等待超过2分钟仍看不到指标,先确认作业存在至少1个source算子,延迟跟踪依赖source节点生成特殊标记向下游传递,没有source的作业不会生成对应指标。
问题2:Datadog上报相关问题
- 只要你已经正确配置了Flink的Datadog指标上报器,延迟指标会和其他系统指标一样自动上报到Datadog,不需要额外配置延迟指标本身的上报规则。
- 上报到Datadog后的指标名称默认带Flink指标前缀,如果你没有修改默认前缀,对应的指标为
flink.latency.*,指标会自动附带作业名、算子ID、子任务索引、source节点ID等标签,你可以直接在Datadog指标浏览器中搜索flink.latency查看。 - 如果搜索不到对应指标,按以下顺序排查:
- 确认
flink-conf.yaml中Datadog Reporter的基础配置正确,包含metrics.reporter.dghttp.class: org.apache.flink.metrics.datadog.DatadogHttpReporter、Datadog API key、上报地址等必填参数。 - 检查是否配置了指标过滤规则,比如
metrics.reporter.dghttp.excludes参数是否将latency类指标排除,若有排除规则,将latency相关指标添加到上报白名单即可。 - 若你使用的Flink版本低于1.13,需要确认已经将Datadog Reporter的依赖Jar包放到Flink的lib目录下,1.13及以上版本内置了该Reporter不需要额外添加。
- 确认
内容的提问来源于stack exchange,提问作者Even
相关产品推荐
相关产品推荐

