You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于Prometheus实现Oracle CDC连接器指标停滞15分钟的告警需求

解决Oracle CDC连接器指标停滞的Prometheus告警配置

针对Oracle CDC连接器挂起时延迟指标长时间不变的问题,可通过以下Prometheus告警规则实现15分钟指标停滞时触发告警:

groups:
- name: kafka-connector-alerts
  rules:
  - alert: OracleCDCConnectorStalled
    expr: changes(kafka_connect_oracle_cdc_source_task_metrics_number{connector='cars-cdc-incremental-load-task-v7',name='streaming-lag-from-source-in-milliseconds'}[15m]) == 0
    for: 1m
    labels:
      severity: critical
      component: kafka-connector
    annotations:
      summary: "Oracle CDC连接器已挂起"
      description: "连接器{{ $labels.connector }}的延迟指标已连续15分钟未发生变化,当前值为{{ $value }}毫秒。需检查连接器状态或重启以恢复数据同步。"

规则说明

  • changes()函数:统计指定时间范围内(此处为15分钟)指标值的变化次数,返回0代表指标值完全未变动
  • [15m]:定义检查指标变化的时间窗口,匹配需求中的15分钟阈值
  • for: 1m:确保指标停滞状态持续1分钟后才触发告警,避免短暂波动导致误报
  • 标签与注释:明确告警级别、关联组件,同时提供具体连接器名称和当前指标值,便于快速定位问题

后续处理建议

告警触发后,可通过以下方式快速恢复:

  • 查看Confluent Connect的Pod日志,定位连接器挂起的具体原因(如Oracle数据库连接异常、权限问题等)
  • 直接重启对应连接器实例:通过Kubernetes命令或Confluent for Kubernetes的CRD操作重启任务
  • 若需自动化恢复,可结合Prometheus Alertmanager配置Webhook,调用Kubernetes API自动重启连接器Pod或重置连接器任务

内容的提问来源于stack exchange,提问作者Rajesh Shanmugam

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.07 10:16:10