如何在运行SLURM交互式作业时获取实时资源使用统计数据
交互式SLURM会话实时资源监控方法
GPU内存与使用率监控
- 单次查看GPU完整状态(含内存占用、使用率、关联进程):
nvidia-smi - 持续刷新监控(每1秒更新一次):
watch -n 1 nvidia-smi - 简洁输出GPU使用率与内存数据,适合长期监控:
nvidia-smi dmon -s um
CPU与内存实时监控
- 查看系统整体CPU、内存占用及单进程资源消耗,顶部会显示活跃CPU核心数:
top - 若集群已安装
htop,可使用更直观的可视化监控界面:htop - 查看所有CPU核心的实时使用率(每1秒更新):
mpstat -P ALL 1 - 实时查看内存占用情况(人类可读格式):
watch -n 1 free -h
SLURM原生监控工具
结合你的作业ID,从SLURM层面直接获取资源统计数据(每1秒刷新):
sstat --format=CPUUtil,MemUsed,GPUUtil,GPUMemUsed -j <你的作业ID> --refresh 1
参数说明:CPUUtil为CPU使用率,MemUsed为已用内存,GPUUtil为GPU使用率,GPUMemUsed为已用GPU内存,可根据需求调整--format后的字段。
内容的提问来源于stack exchange,提问作者desert_ranger
相关产品推荐
相关产品推荐

