You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Slurm工作节点无法连接主节点 解析主节点hostname报错如何解决?

问题根因

工作节点侧未配置主节点主机名ubu18gpu-210的解析规则:

  • 主节点可以正常识别两台节点,是因为slurm.conf中已经显式配置了两个节点的NodeAddr静态IP,主节点读取配置即可直接获取IP无需走主机名解析
  • 工作节点的slurmd进程启动后需要主动向SlurmctldHost参数指定的主节点主机名发起注册,此时工作节点本地没有该主机名到对应IP的映射关系,因此触发getaddrinfo解析失败报错
    你之前验证的IP互通、端口开放、时间同步均为正常必要条件,但遗漏了主机名解析层面的校验。
解决方案

步骤1:验证解析问题

登录工作节点ubu18gpu-211,执行命令:

ping ubu18gpu-210

返回Name or service not known即可确认是解析故障。

步骤2:配置主机名解析

小规模集群推荐直接修改主机映射文件,操作如下:

  1. 分别登录主节点和工作节点,编辑/etc/hosts文件,在末尾添加两行记录:
192.168.23.210 ubu18gpu-210
192.168.23.211 ubu18gpu-211
  1. 配置完成后在工作节点再次执行ping ubu18gpu-210,确认可以正常解析到IP并通网。

步骤3:重启服务验证

在工作节点执行命令重启slurmd服务:

systemctl restart slurmd

查看slurmd运行日志确认无报错后,回到主节点执行scontrol show nodes ubu18gpu-211,可观察到SlurmdStartTime字段已更新为最新启动时间,节点状态正常,集群可正常调度作业。


内容的提问来源于stack exchange,提问作者Alex

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.03 14:06:03