AWS ElasticSearch新增2个数据节点后总节点数远超预期问题咨询
OpenSearch集群节点数异常排查步骤
- 第一步:调用集群节点查询API确认节点角色分布
执行GET _cat/nodes?v=true&h=name,node.role,ip,master命令,分别统计标记为专用主节点(角色标识为m)、*数据节点(角色标识为d)*的节点数量。如果统计结果符合3个主节点+4个数据节点的预期,剩余5个节点无对应业务角色、也不参与主节点选举,即可判定为蓝绿部署残留的旧环境节点。 - 第二步:校验分片分配情况
执行GET _cat/shards?v=true命令,查看所有索引分片的分配节点信息。如果全部分片都分配在你预期的7个新节点上,无分片分配到剩余5个节点,说明旧节点已经停止承载业务负载。 - 第三步:核对域更新状态
进入OpenSearch域控制台的配置更新历史页,确认最近一次扩容操作的状态是否为成功。如果状态长期显示为「进行中」,说明蓝绿部署的收尾流程卡住,未自动触发旧节点下线操作。 - 第四步:核对CloudWatch细分指标
不要仅参考总节点数指标,分别查看MasterNodes、DataNodes两个细分指标:如果两个指标长期稳定在3和4,且ClusterStatus.green始终为1,说明集群核心配置已经生效,总节点数统计包含待下线旧节点属于统计口径问题,不影响业务运行。 - 第五步:验证节点负载情况
执行GET _nodes/stats/os,process命令,查看5个疑似旧节点的CPU、内存、请求处理量指标,如果指标长期处于极低空载状态,即可确认该部分节点未承担实际业务。
补充说明:只要以上校验项均符合预期,该情况不属于新配置异常,本质是云平台蓝绿部署的旧节点资源未自动回收,不会影响当前业务稳定性,可联系云厂商手动清理残留节点即可。
内容的提问来源于stack exchange,提问作者madipi
相关产品推荐
相关产品推荐

