Ubuntu 23.10下RTX 3080ti CUDA训练频繁死机问题求助
系统频繁死机问题求助(深度学习训练场景)
问题核心情况
- 近几周在深度学习模型训练过程中频繁触发系统死机,REISUB指令通常也无法恢复,只能手动关机
- 偶尔出现开机几秒后死机的情况,无法稳定复现
- 因需向客户交付更新后的模型,当前面临较大交付压力
初步排查背景
此前曾成功完成模型训练,推测问题可能出在软件包、Ubuntu版本或Nvidia驱动(使用ppa:graphics-drivers源):
- 问题初现时尝试了所有可用Nvidia驱动,均未解决(nouveau驱动从未成功运行)
- 从Ubuntu 22.04 LTS升级到23.10后,解决了当时mutter包(~46版本)导致的控制台卡顿问题,但死机现象仍未消除
- 查阅大量论坛帖子后仍未找到解决方案
硬件与系统环境
硬件信息
- 显卡:Nvidia RTX 3080ti
- 显示配置:连接三台显示器,采用Windows+Ubuntu双系统
- 当前驱动:nvidia-driver-535,配套nvidia-firmware-535-535.171.04
nvidia-smi输出
+---------------------------------------------------------------------------------------+ | NVIDIA-SMI 535.171.04 Driver Version: 535.171.04 CUDA Version: 12.2 | |-----------------------------------------+----------------------+----------------------+ | GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |=========================================+======================+======================| | 0 NVIDIA GeForce RTX 3080 Ti Off | 00000000:01:00.0 On | N/A | | 0% 44C P8 63W / 350W | 316MiB / 12288MiB | 20% Default | | | | N/A | +-----------------------------------------+----------------------+----------------------+ +---------------------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=======================================================================================| | 0 N/A N/A 2070 G /usr/lib/xorg/Xorg 153MiB | | 0 N/A N/A 2252 G /usr/bin/gnome-shell 155MiB | +---------------------------------------------------------------------------------------+
驱动配置文件(/etc/modprobe.d/nvidia-graphics-drivers-kms.conf)
# This file was generated by nvidia-driver-535 # Set value to 0 to disable modesetting options nvidia-drm modeset=0
操作系统与深度学习环境
- 操作系统:Ubuntu 23.10,内核版本6.5.0-35-generic
- gcc版本:13.2.0
- 深度学习环境:Python 3.11.4、PyTorch框架,基于CUDA训练,训练过程中GPU内存充足
死机场景特征
- 训练期间详细日志未发现明确触发点
- 直观观察:死机最常发生在从CPU加载数据并推送到GPU(CUDA)期间,或反向传播过程中的某个阶段
已尝试的解决方案
- 启动训练前将nvidia-settings(PowerMizer)设置为“Prefer Maximum Performance”
- 使用
watch -n 1 free -m排查内存泄漏,确认无泄漏且死机时交换分区未使用,排除内存问题 - 禁用Wayland,使用Xorg(未尝试启用Wayland)
- 尝试仅连接单台显示器(无HDMI),问题仍存在
日志排查结果
dmesg错误日志输出:
dmesg --level=emerg,alert,crit,err [ 0.150278] x86/cpu: SGX disabled by BIOS.
疑问
有帖子建议在BIOS中启用SGX,请问这是否与当前死机问题相关?
内容的提问来源于stack exchange,提问作者Max
相关产品推荐
相关产品推荐

