如何在Slurm作业脚本中设置GPU计算能力≥7的约束避免提交报错
解决方案
你遇到的报错是因为使用的cc7.0特征标签和所在集群Slurm配置的节点特征命名不匹配,你参考的教程对应集群的特征命名规则并不适用于当前使用的集群,可按以下步骤排查修改:
- 第一步:查询当前集群所有节点的可用特征标签,执行命令:
sinfo -o "%n %f"
也可以单独查询你使用的gpu-L分区的节点特征,缩小范围:
sinfo -p gpu-L -o "%N %f"
返回结果的第二列就是对应节点配置的特征标签,找到对应GPU计算能力≥7的标签,常见命名规则包括sm_70、sm_75、sm_80、cc7、gpu_ampere等。
- 第二步:根据查询到的标签修改约束参数,如果需要匹配所有计算能力≥7的GPU,可使用Slurm约束的OR逻辑(用
|分隔),比如你查询到对应标签为sm_70、sm_75、sm_80、sm_86,就把约束参数改为:
#SBATCH --constraint="sm_70|sm_75|sm_80|sm_86"
- 备选方案:如果你的集群Slurm支持GRES扩展配置,也可以直接在GPU请求参数中指定计算能力要求,写法如下:
#SBATCH --gres=gpu:1,compute_capability=7.0 # 部分集群写法为 #SBATCH --gres=gpu:1:cc7.0
修改后重新提交作业即可正常生效。
内容的提问来源于stack exchange,提问作者Mona Jalal
相关产品推荐
相关产品推荐

