You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Slurm环境下Ray Dashboard连接失败问题求助

Slurm环境下Ray Dashboard无法连接的排查与解决

可能的问题原因

1. 脚本配置问题

  • 未指定Dashboard绑定地址:默认Ray Head节点可能仅绑定集群内部IP,而非0.0.0.0,导致本地无法访问
  • 端口未显式开放:Ray启动时未指定固定端口,或Slurm未申请对应端口资源,请求被集群安全策略拦截
  • 关键环境变量缺失:RAY_DASHBOARD_HOST等变量未配置,导致服务绑定范围受限

2. 网络/集群环境问题

  • 本地与Slurm节点网络隔离:直接用127.0.0.1仅能访问本地,无法触及集群内的Head节点
  • 集群防火墙限制:Head节点的8365端口未对外开放,本地请求被拦截

具体排查与解决步骤

步骤1:修正Ray Head启动参数

修改Slurm脚本中启动Head节点的命令,强制绑定所有网卡并指定端口:

ray start --head --dashboard-host 0.0.0.0 --dashboard-port 8365

步骤2:获取Head节点实际IP

启动后查看日志,找到类似View the dashboard at http://<head-node-ip>:8365的输出,记录这个集群内部/公网IP,不要用本地回环地址127.0.0.1。

步骤3:配置本地SSH端口转发

如果本地无法直接访问Head节点IP,用SSH将集群端口映射到本地:

ssh -L 8365:<head-node-ip>:8365 <你的用户名>@<Slurm登录节点IP>

执行后在本地浏览器访问http://127.0.0.1:8365即可连接Dashboard。

步骤4:检查Slurm资源与防火墙

  • 部分集群需显式申请端口资源,在Slurm脚本中添加:#SBATCH --gres=port:8365
  • 在本地执行telnet <head-node-ip> 8365测试端口连通性,不通则联系集群管理员开放端口

步骤5:验证Ray集群状态

在Slurm节点执行以下命令,确认Head节点及Dashboard服务正常运行:

ray status

若输出无Dashboard相关信息,检查启动日志中的错误(如端口被占用、资源不足)。

示例修改后的Slurm脚本片段

#!/bin/bash
#SBATCH --job-name=ray-cluster
#SBATCH --nodes=1
#SBATCH --ntasks-per-node=1
#SBATCH --cpus-per-task=4
#SBATCH --mem=16G

# 加载集群Ray环境(根据实际配置调整)
module load ray

# 启动Head节点并绑定所有网卡
ray start --head --dashboard-host 0.0.0.0 --dashboard-port 8365

# 保持任务运行,防止Slurm自动终止
sleep infinity

内容的提问来源于stack exchange,提问作者Shijie Cao

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.12 10:42:09