Elasticsearch _reindex突然无响应故障排查求助
Elasticsearch _reindex停滞故障解决建议
问题根源
节点磁盘使用率达93.8%,超过集群设置的high水位线(cluster.routing.allocation.disk.watermark.high=90%),实际可用空间16.5GB低于要求的27GB,导致新索引分片无法分配,最终引发_reindex操作停滞。
具体解决步骤
紧急释放磁盘空间
- 清理Windows系统冗余:用系统自带「磁盘清理」工具删除临时文件、下载文件、回收站内容;卸载不常用软件,优先把磁盘使用率降到90%以下,或让可用空间达到27GB以上。
- 删除ES无用旧索引:执行
DELETE /old_index_name命令清理不再需要的索引,操作前务必备份重要数据。 - 清理本地快照文件:如果ES快照存储在本地磁盘,删除不需要的快照释放空间。
临时调整磁盘水位线(应急方案)
若暂时无法快速释放足够空间,可临时修改水位线参数让ES允许分片分配:- 执行动态参数修改命令:
PUT /_cluster/settings { "persistent": { "cluster.routing.allocation.disk.watermark.high": "95%", "cluster.routing.allocation.disk.watermark.low": "92%" } } - 等待集群重新分配分片,完成_reindex后,记得将水位线改回原设置,避免磁盘耗尽风险。
- 执行动态参数修改命令:
后续优化措施
- 建立索引生命周期管理(ILM)策略,自动归档或删除过期索引,减少磁盘占用。
- 考虑将ES数据目录迁移到更大容量的磁盘,从根源解决空间不足问题。
- 配置ES磁盘使用监控告警,提前预警磁盘空间不足情况。
内容的提问来源于stack exchange,提问作者mike rodent
相关产品推荐
相关产品推荐

