You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

手动启动Ray集群工作节点连接头节点获取系统配置超时如何解决

报错原因

该报错本质是工作节点无法正常和头节点的GCS(全局控制存储)服务通信,在指定超时时间内拉取不到集群系统配置,常见触发原因如下:

  1. 网络连通性故障:头节点6379端口或Ray其他通信端口被防火墙/安全组拦截,两台节点之间二层/三层网络不可达
  2. Redis密码不匹配:头节点启动时未显式指定Redis密码,默认生成的随机密码和工作节点传入的密码不一致,导致鉴权失败无法访问GCS
  3. 版本不兼容:头节点和工作节点安装的Ray版本不一致,内部通信协议不匹配导致配置拉取失败
  4. 头节点服务异常:头节点的GCS服务未正常启动,本身无法对外提供配置查询能力

解决方案

  • 排查网络连通性:在工作节点执行ping 10.50.131.250确认网络可达,再执行telnet 10.50.131.250 6379验证Redis端口可访问。同时在两台节点放行Ray所需端口:TCP 6379、TCP 8265、TCP 10001,以及10000-20000的动态端口范围,或临时关闭防火墙测试。
  • 统一鉴权配置:重新启动头节点,启动命令显式指定密码:ray start --head --port=6379 --redis-password='5241590000000000',再用原来的工作节点命令接入即可。
  • 对齐Ray版本:分别在头节点和工作节点执行pip show ray检查版本,若版本不一致,通过pip install ray==<统一版本号>安装相同版本的Ray后重试。
  • 验证头节点状态:在头节点执行ray status确认集群状态正常,若头节点本身报错,先执行ray stop清理所有进程,再重新启动头节点。
  • 若以上操作无效,可在工作节点接入命令末尾添加--verbose参数,输出更详细的日志定位具体问题。

内容的提问来源于stack exchange,提问作者Robert Huang

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.29 04:24:00