如何监控Azure Data Factory内部管道的重试次数、负载大小、并发作业等参数?
Azure Data Factory 非内置指标监控方案
1. ADF 原生API拉取自定义统计
- 调用
Pipeline Runs - Query By FactoryREST接口,可直接获取单条管道运行的重试次数、输入输出payload元数据大小,支持按1分钟到7天的时间窗口批量拉取,可自行聚合统计周期内的重试率、平均payload大小等指标 - 调用
Activity Runs - Query By Pipeline Run接口拉取所有运行中管道的活动列表,过滤状态为InProgress的条目即可统计实时并发作业数量,还可按活动类型、资源分组做更细粒度的并发统计 - 可搭配定时运行的无服务函数做周期性拉取,计算后的数据可直接写入你常用的监控系统存储
2. 关联下游计算资源监控数据
- 如果管道使用自托管IR/ Azure IR,可直接拉取IR运行所在的虚拟机/虚拟机集群的性能指标:包括CPU使用率、内存占用、磁盘IO、网络吞吐,这类基础设施参数直接从对应计算资源的监控面板获取即可,无需依赖ADF内置指标
- 如果管道用到Databricks、Synapse、SQL数据库等外部计算组件,直接关联对应组件的性能指标(比如SQL DB的DTU/CPU使用率、Databricks集群的任务队列长度),和ADF管道运行时间线对齐即可排查性能瓶颈
3. 管道自定义埋点上报
- 可在管道的重试节点、数据处理节点前后添加自定义上报逻辑(比如Web Activity),主动上报你需要的自定义参数:比如转换前后的payload大小、自定义重试标记、作业资源占用等字段
- 上报的日志可直接写入Log Analytics工作区,通过KQL语句做自定义聚合统计,生成专属的性能监控大盘
内容的提问来源于stack exchange,提问作者Kavya Verma
相关产品推荐
相关产品推荐

