如何在Slurm集群中配置NVIDIA GPU?配置文件及参数疑问
Slurm集群单NVIDIA GPU配置示例及参数说明
一、slurm.conf 中的GPU相关配置
在slurm.conf中添加以下关键配置项(根据你的节点实际信息调整):
# 启用GPU类型的GRES资源 GresTypes=gpu # 为目标节点配置GPU资源(示例节点名为compute01) NodeName=compute01 Gres=gpu:1 CPUs=16 Mem=64G State=UNKNOWN # 分区配置(关联该节点) PartitionName=general Nodes=compute01 Default=YES MaxTime=24:00:00 State=UP
GresTypes=gpu:声明集群要使用GPU类型的通用资源(GRES)Gres=gpu:1:指定该节点拥有1块可用的NVIDIA GPU
二、gres.conf 配置示例
创建并编辑gres.conf文件,添加如下内容:
# 映射节点的GPU物理设备 NodeName=compute01 Name=gpu File=/dev/nvidia0
三、File=/dev/nvidia0 的具体含义
/dev/nvidia0是Linux系统为第一块识别到的NVIDIA GPU创建的字符设备文件,系统通过这个文件实现对GPU硬件的读写和控制。File=/dev/nvidia0的作用是告诉Slurm:当前节点上名为gpu的GRES资源,对应的物理硬件设备就是/dev/nvidia0,让Slurm能够精准识别、跟踪和调度这块GPU资源。- 若节点有多块GPU,系统会依次生成
/dev/nvidia1、/dev/nvidia2等设备文件,配置时只需对应添加即可。
内容的提问来源于stack exchange,提问作者Emma Athan
相关产品推荐
相关产品推荐

