Slurm工作节点无法连接主节点 解析主节点hostname报错如何解决?
问题根因
工作节点侧未配置主节点主机名ubu18gpu-210的解析规则:
- 主节点可以正常识别两台节点,是因为
slurm.conf中已经显式配置了两个节点的NodeAddr静态IP,主节点读取配置即可直接获取IP无需走主机名解析 - 工作节点的
slurmd进程启动后需要主动向SlurmctldHost参数指定的主节点主机名发起注册,此时工作节点本地没有该主机名到对应IP的映射关系,因此触发getaddrinfo解析失败报错
你之前验证的IP互通、端口开放、时间同步均为正常必要条件,但遗漏了主机名解析层面的校验。
解决方案
步骤1:验证解析问题
登录工作节点ubu18gpu-211,执行命令:
ping ubu18gpu-210
返回Name or service not known即可确认是解析故障。
步骤2:配置主机名解析
小规模集群推荐直接修改主机映射文件,操作如下:
- 分别登录主节点和工作节点,编辑
/etc/hosts文件,在末尾添加两行记录:
192.168.23.210 ubu18gpu-210 192.168.23.211 ubu18gpu-211
- 配置完成后在工作节点再次执行
ping ubu18gpu-210,确认可以正常解析到IP并通网。
步骤3:重启服务验证
在工作节点执行命令重启slurmd服务:
systemctl restart slurmd
查看slurmd运行日志确认无报错后,回到主节点执行scontrol show nodes ubu18gpu-211,可观察到SlurmdStartTime字段已更新为最新启动时间,节点状态正常,集群可正常调度作业。
内容的提问来源于stack exchange,提问作者Alex
相关产品推荐
相关产品推荐

