基于Cloudera Manager的Hadoop集群监控可观测性技术问询
Cloudera Manager 集群监控与可观测性问题解答
1. Cloudera的指标存储位置及时序数据库属性
- 默认情况下,Cloudera Manager 的指标存储在其内置的 Cloudera Management Service 中的 Monitoring Service 组件内,底层依赖嵌入式或外部部署的 PostgreSQL/MySQL 作为存储介质。
- 该内置存储并非专门的时序数据库(TSDB),它是经过时序数据优化的关系型数据库,但原生不具备TSDB的高写入、高查询性能及专属时序特性。
2. 指标收集方式及Exporter使用情况
- Cloudera Manager 依赖内置的 Cloudera Manager Agent完成集群所有服务(HDFS、YARN、MapReduce等)及主机指标的采集,无需额外部署JMX Exporter。
- Agent会定期从各服务的JMX端点、服务API及系统层面抓取指标,统一上报至Cloudera Manager的Monitoring Service。
- 若需对接外部监控系统,Cloudera官方提供Cloudera Manager Exporter,可将Cloudera Manager的指标转换为Prometheus兼容格式导出。
3. Cloudera Manager作为Grafana数据源的可行性
- 可以直接将Cloudera Manager作为Grafana的数据源,通过Grafana的Cloudera Manager插件实现对接,无需额外中转。
- 插件支持直接调用Cloudera Manager的指标API,展示集群、服务、主机的监控数据,同时可利用Grafana的可视化能力自定义仪表盘。
核心架构方案建议
方案对比与选择
方案1:为每个服务JVM部署JMX Exporter
- 优点:可直接抓取每个JVM的细粒度指标,不受Cloudera Manager的指标采集范围限制,适合深度自定义指标的场景。
- 缺点:部署维护成本高,每个节点的每个JVM都需配置管理Exporter,无法复用Cloudera Manager已有的监控采集逻辑,易出现指标重复采集问题。
方案2:指标导入Prometheus类TSDB+Grafana查询
- 推荐采用此方案,具体架构流程:
- 部署Cloudera Manager Exporter,对接Cloudera Manager API,将集群指标转换为Prometheus兼容格式。
- 配置Prometheus定期抓取Exporter的指标,存储至Prometheus(或VictoriaMetrics、Thanos等TSDB)。
- 将Grafana对接Prometheus作为数据源,利用现成的Cloudera/Hadoop监控仪表盘模板,或自定义可视化内容。
- 补充:如需主机层面的系统指标,可配合Node Exporter,将其指标与Cloudera Manager导出的指标统一存储到Prometheus,实现全栈监控。
方案2的优势
- 复用Cloudera Manager已有的监控采集能力,无需重复部署大量Exporter,降低维护成本。
- 借助TSDB的时序数据处理能力,解决Cloudera Manager内置存储查询性能不足的问题,支持长期指标存储与复杂查询。
- Grafana+Prometheus生态成熟,有大量现成的监控模板和告警规则,可快速搭建可观测性平台。
内容的提问来源于stack exchange,提问作者Liran Eliyahu
相关产品推荐
相关产品推荐

