AWS Elasticsearch Service节点持续尝试连接未知目标报连接拒绝错误求助
我来帮你拆解这个问题——结合你的集群配置和日志细节,这个警告其实是AWS托管ES的内部小问题,不是你的配置或原生OpenDistro的通用bug,具体分析如下:
先抓日志里的关键线索
你提到的警告核心信息是:
[2021-08-19T04:41:42,118][WARN ][r.suppressed] [NODE_ID] path: __PATH__ params: {redirectEndpoint=metrics} java.net.ConnectException: Connection refused (Connection refused)
堆栈里的__AMAZON_INTERNAL__标记也明确了,这是AWS定制的内部代码逻辑触发的,和你自己的业务配置、集群节点间通信无关——毕竟单节点环境也会出现,完全排除了集群拓扑的问题。
问题的本质
这个警告是AWS ES内部的metrics采集组件尝试访问一个内部metrics端点时触发的连接失败。在你使用的版本(7.9.1,服务版本R20210426-P2)里,可能存在一个小bug:比如内部端点还未完全就绪,采集组件就发起了请求,或者内部端口/地址配置有临时偏差,导致连接被拒绝。
要不要优先处理?
如果你的集群核心业务(索引、查询、数据同步等)运行正常,完全可以暂时忽略这个警告:
- 它是非破坏性的,不会影响集群的核心功能
- 只是内部metrics采集的小失败,不会导致数据丢失或服务中断
如果日志噪音太大影响排查其他问题,可以先做日志过滤。
可行的解决/缓解方案
1. 升级AWS ES服务版本
AWS后续发布的7.9.1补丁版本(比如R20210721及以后)或者更高主版本,已经修复了这个内部连接问题。你可以在AWS控制台的ES集群页面,查看「Service software updates」选项,按照提示完成升级(记得升级前做好数据备份)。
2. 屏蔽冗余日志
在CloudWatch日志组中创建过滤规则,把包含以下内容的日志排除:
path: __PATH__ params: {redirectEndpoint=metrics} java.net.ConnectException: Connection refused
这样可以减少日志噪音,不影响其他重要日志的查看。
3. 联系AWS Support
如果这个警告导致日志量暴增,或者你担心潜在的隐性影响,可以提交AWS Support工单,提供你的集群ID、日志片段和版本信息,AWS技术团队会直接确认这是已知问题并给出针对性指导。
内容的提问来源于stack exchange,提问作者apt-get_install_skill

