You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在运行SLURM交互式作业时获取实时资源使用统计数据

交互式SLURM会话实时资源监控方法

GPU内存与使用率监控

  • 单次查看GPU完整状态(含内存占用、使用率、关联进程):
    nvidia-smi
    
  • 持续刷新监控(每1秒更新一次):
    watch -n 1 nvidia-smi
    
  • 简洁输出GPU使用率与内存数据,适合长期监控:
    nvidia-smi dmon -s um
    

CPU与内存实时监控

  • 查看系统整体CPU、内存占用及单进程资源消耗,顶部会显示活跃CPU核心数:
    top
    
  • 若集群已安装htop,可使用更直观的可视化监控界面:
    htop
    
  • 查看所有CPU核心的实时使用率(每1秒更新):
    mpstat -P ALL 1
    
  • 实时查看内存占用情况(人类可读格式):
    watch -n 1 free -h
    

SLURM原生监控工具

结合你的作业ID,从SLURM层面直接获取资源统计数据(每1秒刷新):

sstat --format=CPUUtil,MemUsed,GPUUtil,GPUMemUsed -j <你的作业ID> --refresh 1

参数说明:CPUUtil为CPU使用率,MemUsed为已用内存,GPUUtil为GPU使用率,GPUMemUsed为已用GPU内存,可根据需求调整--format后的字段。

内容的提问来源于stack exchange,提问作者desert_ranger

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.01 10:42:13