You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Slurm集群中配置NVIDIA GPU?配置文件及参数疑问

Slurm集群单NVIDIA GPU配置示例及参数说明

一、slurm.conf 中的GPU相关配置

在slurm.conf中添加以下关键配置项(根据你的节点实际信息调整):

# 启用GPU类型的GRES资源
GresTypes=gpu

# 为目标节点配置GPU资源(示例节点名为compute01)
NodeName=compute01 Gres=gpu:1 CPUs=16 Mem=64G State=UNKNOWN

# 分区配置(关联该节点)
PartitionName=general Nodes=compute01 Default=YES MaxTime=24:00:00 State=UP
  • GresTypes=gpu:声明集群要使用GPU类型的通用资源(GRES)
  • Gres=gpu:1:指定该节点拥有1块可用的NVIDIA GPU

二、gres.conf 配置示例

创建并编辑gres.conf文件,添加如下内容:

# 映射节点的GPU物理设备
NodeName=compute01 Name=gpu File=/dev/nvidia0

三、File=/dev/nvidia0 的具体含义

  • /dev/nvidia0是Linux系统为第一块识别到的NVIDIA GPU创建的字符设备文件,系统通过这个文件实现对GPU硬件的读写和控制。
  • File=/dev/nvidia0的作用是告诉Slurm:当前节点上名为gpu的GRES资源,对应的物理硬件设备就是/dev/nvidia0,让Slurm能够精准识别、跟踪和调度这块GPU资源。
  • 若节点有多块GPU,系统会依次生成/dev/nvidia1、/dev/nvidia2等设备文件,配置时只需对应添加即可。

内容的提问来源于stack exchange,提问作者Emma Athan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.18 11:34:56