MSK Connect 3.7.x中Kafka连接器每6分钟自动重启问题求助
AWS MSK Connect 3.7.x Worker每6分钟规律性重启的可能原因
- 资源阈值触发重启:3.7.x版本可能调整了Worker的资源监控判定逻辑,哪怕实际负载不高,CPU、内存等指标的微小波动也可能触达阈值,触发周期性重启回收。可以查看CloudWatch中对应Worker的资源指标,确认重启前是否有指标异常波动。
- 心跳/会话超时机制变更:新版本修改了Worker与MSK控制平面的心跳间隔或会话超时默认值,导致控制平面误判Worker失联,主动发送关机信号重启。对比2.7.1版本的
session.timeout.ms、heartbeat.interval.ms等配置的默认值,排查是否存在版本间的配置差异。 - 健康检查逻辑调整:MSK Connect托管服务在3.7.x版本更新了健康检查规则,比如健康检查接口的响应阈值变严格,每6分钟一次的健康检查未通过,进而触发Worker重启。可以尝试开启更详细的日志级别,排查是否有健康检查相关的隐式日志记录。
- 底层依赖兼容性问题:3.7.x版本依赖的JDK、Kafka Client等底层库与MSK托管环境的基础设施(如OS版本、系统组件)存在兼容性问题,导致周期性的资源泄漏或隐性死锁,触发系统层面的强制重启。本地Docker环境和MSK托管环境的底层依赖不一致,因此未暴露该问题。
- 后台任务异常导致重启:新版本新增了每6分钟执行的后台任务(如元数据同步、配置刷新),任务执行时出现未捕获的隐性异常(未打印错误日志),导致Worker进程被强制重启。开启DEBUG级别的日志,查看重启前是否有相关后台任务的执行记录。
- 默认配置项变更:3.7.x版本修改了
restart.interval.ms等自动重启相关配置的默认值,导致Worker每6分钟主动触发一次重启。检查连接器的Worker配置,确认是否存在这类默认启用的自动重启配置。
内容的提问来源于stack exchange,提问作者Andrey M.
相关产品推荐
相关产品推荐

