You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Clickhouse集群Kafka引擎报错‘15/15 brokers are down’排查求助

ClickHouse Kafka引擎报错[rdk:ERROR] [thrd:GroupCoordinator]: 15/15 brokers are down排查思路

问题背景

三节点ClickHouse测试集群(版本23.1.3.5)中创建了若干ENGINE = Kafka()的表,日志频繁出现错误:[rdk:ERROR] [thrd:GroupCoordinator]: 15/15 brokers are down。经确认所有Kafka Broker运行正常,16个消费主题无延迟,重启ClickHouse服务或删除重建表可消除错误,已尝试禁用DNS缓存但无效,怀疑是否因数据量过少导致,寻求其他排查方向。

排查思路

  • 检查Kafka客户端与Broker版本兼容性:ClickHouse 23.1.3.5依赖的librdkafka版本可能和你的Kafka Broker存在兼容性问题。执行SELECT * FROM system.kafka_consumers查看客户端版本,对比Kafka Broker版本,针对性调整表引擎配置参数(如security.protocol、sasl.mechanism、compression.type等)。
  • 排查Group Coordinator网络连通性:错误指向Group Coordinator,可能是ClickHouse节点与该Coordinator节点存在间歇性网络故障。在ClickHouse节点持续执行telnet <coordinator-broker-ip> <kafka-port>或nc -zv <coordinator-broker-ip> <kafka-port>测试连通性,同时查看系统网络日志(如/var/log/messages、dmesg)是否有丢包、连接重置记录。
  • 检查Kafka消费者组状态:执行kafka-consumer-groups.sh --bootstrap-server <kafka-broker-ip> --describe --group <clickhouse-consumer-group>(ClickHouse Kafka表默认用表名作为消费者组),查看消费者组的Coordinator状态是否正常,是否存在COORDINATOR_UNAVAILABLE,以及位移提交是否异常。
  • 调整Kafka表引擎参数:检查kafka_session_timeout_ms、kafka_heartbeat_interval_ms、kafka_max_wait_ms等参数设置。若session timeout过短,网络短暂波动就可能被判定为消费者离线,触发Coordinator连接报错。可尝试调大kafka_session_timeout_ms(如从默认30000改为60000),同时将kafka_heartbeat_interval_ms设为其1/3左右。
  • 排查ClickHouse节点资源瓶颈:当节点CPU、内存或磁盘IO过高时,librdkafka客户端无法及时与Coordinator通信,引发报错。用top、iostat、free等命令监控资源使用,确认报错时段是否存在资源耗尽情况。
  • 验证Kafka Coordinator稳定性:查看Kafka Broker日志中Group Coordinator相关记录,是否有重启、选举失败等异常。执行kafka-topics.sh --bootstrap-server <kafka-broker-ip> --describe --topic __consumer_offsets,确认消费者位移主题的副本状态是否正常,ISR是否完整。
  • 测试数据量影响:手动向测试主题发送一批数据,观察报错是否减少或消失,验证数据量过少的猜想。若数据长期空闲,Broker可能主动断开连接,可在Kafka表引擎配置中添加connections_max_idle_ms参数,调整空闲连接超时时间。

内容的提问来源于stack exchange,提问作者kev

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.19 01:43:12