如何在合上笔记本的情况下在GPU服务器训练深度学习模型
问题解答
你不需要连续4天保持笔记本开机,训练任务运行在远程GPU服务器上,仅需让训练进程脱离SSH会话绑定,即可在本地断开连接、关闭设备的前提下持续运行。
常用后台运行方案
- nohup 命令(最简方案):直接在终端执行
nohup bash run.sh &即可,训练的所有输出会默认写入当前目录下的nohup.out文件,断开SSH、关闭本地设备都不会影响训练进程。后续重连服务器后可执行tail -f nohup.out查看实时训练日志。 - tmux 会话管理(更推荐):先在服务器上安装tmux(多数服务器默认自带,无权限可通过conda安装),执行
tmux new -s espnet_asr创建专属训练会话,在会话内正常执行bash run.sh启动训练后,按Ctrl+B再按D即可将会话放到后台,此时可直接断开SSH连接。后续重连后执行tmux attach -t espnet_asr即可回到训练会话查看完整进度、执行中断等操作。
ESPNet训练注意事项
- 启动训练前先确认run.sh中的checkpoint保存配置,开启定期自动保存功能,遇到服务器断电、进程异常退出等情况时,可从最近的checkpoint续训,避免从头重新训练。
- 正式训练前先使用小批量数据跑通完整训练流程,确认数据路径、GPU调用、损失计算、checkpoint保存、日志输出都正常,避免长时间训练后才发现配置错误浪费算力。
- 你当前服务器的CUDA 10.2版本与驱动版本匹配,24G显存的Quadro RTX 6000完全可以支撑ESPNet常规ASR模型训练,注意合理调整batch size避免爆显存即可。训练启动后可执行
nvidia-smi查看GPU占用情况,确认训练正常调用GPU资源。 - 训练过程中如果需要确认进程状态,可执行
ps aux | grep run.sh查看训练进程是否存活,也可通过nvidia-smi查看GPU上运行的计算进程判断训练状态。
内容的提问来源于stack exchange,提问作者Thomas Lee
相关产品推荐
相关产品推荐

