Bitnami K8s Redis集群重启Pod后nodes.conf IP未更新问题
针对Bitnami redis-cluster 6.3.6 Helm Chart部署K8s Redis集群重启Pod后nodes.conf不更新IP问题的解决方案
问题根因
6.3.6版本的redis-cluster Helm Chart内置的容器启动脚本缺失Pod重启后的IP变更检测逻辑,Redis集群依赖nodes.conf存储节点拓扑信息,Pod重启后IP发生变化,但旧的IP记录残留在配置文件中,导致节点无法完成集群握手,一直卡在未就绪状态。
可落地解决方案
- 方案1:小版本升级Chart(推荐)
该问题属于6.3.6版本的已知缺陷,官方在后续6.3.x系列补丁版本中已经修复了启动脚本的IP自动刷新逻辑,直接将Helm Chart升级到6.3.8及以上的6.3.x兼容版本即可,升级过程不会破坏现有集群数据,操作前提前给持久卷做快照备份即可。 - 方案2:自定义启动命令适配(不升级Chart的场景)
通过values.yaml覆盖主从节点的默认启动命令,在Redis进程启动前自动修正nodes.conf中当前节点的IP记录,配置示例如下:
配置更新后执行# 主节点启动命令覆盖 master: command: - /bin/bash - -c - | CURRENT_POD_IP=$(hostname -i) SELF_NODE_ID=$(grep "myself,master" /bitnami/redis/data/nodes.conf | awk '{print $1}') if [ -f /bitnami/redis/data/nodes.conf ] && [ -n "$SELF_NODE_ID" ]; then sed -i "s/^${SELF_NODE_ID} .* myself,master/${SELF_NODE_ID} ${CURRENT_POD_IP}:6379@16379 myself,master/g" /bitnami/redis/data/nodes.conf fi exec /opt/bitnami/scripts/redis-cluster/run.sh # 从节点启动命令覆盖 replica: command: - /bin/bash - -c - | CURRENT_POD_IP=$(hostname -i) SELF_NODE_ID=$(grep "myself,slave" /bitnami/redis/data/nodes.conf | awk '{print $1}') if [ -f /bitnami/redis/data/nodes.conf ] && [ -n "$SELF_NODE_ID" ]; then sed -i "s/^${SELF_NODE_ID} .* myself,slave/${SELF_NODE_ID} ${CURRENT_POD_IP}:6379@16379 myself,slave/g" /bitnami/redis/data/nodes.conf fi exec /opt/bitnami/scripts/redis-cluster/run.shhelm upgrade命令生效,后续所有Pod重启时都会自动修正IP记录,不会再出现节点无法就绪的问题。 - 方案3:单节点故障应急修复
如果只是单个Pod重启后卡住,不需要全量更新配置,直接进入异常Pod手动修正配置即可快速恢复:
执行完成后删除该异常Pod触发重启,节点就能正常加入集群。# 进入异常Pod终端 kubectl exec -it <异常Redis Pod名称> -- bash # 获取当前Pod实际IP CURRENT_POD_IP=$(hostname -i) # 提取当前节点在集群中的唯一ID SELF_NODE_ID=$(grep "myself" /bitnami/redis/data/nodes.conf | awk '{print $1}') # 替换nodes.conf中残留的旧IP记录 sed -i "s/^${SELF_NODE_ID} .* myself/${SELF_NODE_ID} ${CURRENT_POD_IP}:6379@16379 myself/g" /bitnami/redis/data/nodes.conf
注意事项:不要直接删除
/bitnami/redis/data/nodes.conf文件,该文件存储了集群节点的唯一身份标识,直接删除会导致节点ID变化,触发集群拓扑混乱,严重时会导致集群不可用。所有变更操作前建议先备份持久卷数据。
内容的提问来源于stack exchange,提问作者Yashasvi Raj Pant
相关产品推荐
相关产品推荐

