You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Ubuntu 23.10下RTX 3080ti CUDA训练频繁死机问题求助

系统频繁死机问题求助(深度学习训练场景)

问题核心情况

  • 近几周在深度学习模型训练过程中频繁触发系统死机,REISUB指令通常也无法恢复,只能手动关机
  • 偶尔出现开机几秒后死机的情况,无法稳定复现
  • 因需向客户交付更新后的模型,当前面临较大交付压力

初步排查背景

此前曾成功完成模型训练,推测问题可能出在软件包、Ubuntu版本或Nvidia驱动(使用ppa:graphics-drivers源):

  • 问题初现时尝试了所有可用Nvidia驱动,均未解决(nouveau驱动从未成功运行)
  • 从Ubuntu 22.04 LTS升级到23.10后,解决了当时mutter包(~46版本)导致的控制台卡顿问题,但死机现象仍未消除
  • 查阅大量论坛帖子后仍未找到解决方案

硬件与系统环境

硬件信息

  • 显卡:Nvidia RTX 3080ti
  • 显示配置:连接三台显示器,采用Windows+Ubuntu双系统
  • 当前驱动:nvidia-driver-535,配套nvidia-firmware-535-535.171.04

nvidia-smi输出

+---------------------------------------------------------------------------------------+
| NVIDIA-SMI 535.171.04             Driver Version: 535.171.04   CUDA Version: 12.2     |
|-----------------------------------------+----------------------+----------------------+
| GPU  Name                 Persistence-M | Bus-Id        Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |         Memory-Usage | GPU-Util  Compute M. |
|                                         |                      |               MIG M. |
|=========================================+======================+======================|
|   0  NVIDIA GeForce RTX 3080 Ti     Off | 00000000:01:00.0  On |                  N/A |
|  0%   44C    P8              63W / 350W |    316MiB / 12288MiB |     20%      Default |
|                                         |                      |                  N/A |
+-----------------------------------------+----------------------+----------------------+
                                                                                         
+---------------------------------------------------------------------------------------+
| Processes:                                                                            |
|  GPU   GI   CI        PID   Type   Process name                            GPU Memory |
|        ID   ID                                                             Usage      |
|=======================================================================================|
|    0   N/A  N/A      2070      G   /usr/lib/xorg/Xorg                          153MiB |
|    0   N/A  N/A      2252      G   /usr/bin/gnome-shell                        155MiB |
+---------------------------------------------------------------------------------------+

驱动配置文件(/etc/modprobe.d/nvidia-graphics-drivers-kms.conf)

# This file was generated by nvidia-driver-535
# Set value to 0 to disable modesetting
options nvidia-drm modeset=0

操作系统与深度学习环境

  • 操作系统:Ubuntu 23.10,内核版本6.5.0-35-generic
  • gcc版本:13.2.0
  • 深度学习环境:Python 3.11.4、PyTorch框架,基于CUDA训练,训练过程中GPU内存充足

死机场景特征

  • 训练期间详细日志未发现明确触发点
  • 直观观察:死机最常发生在从CPU加载数据并推送到GPU(CUDA)期间,或反向传播过程中的某个阶段

已尝试的解决方案

  • 启动训练前将nvidia-settings(PowerMizer)设置为“Prefer Maximum Performance”
  • 使用watch -n 1 free -m排查内存泄漏,确认无泄漏且死机时交换分区未使用,排除内存问题
  • 禁用Wayland,使用Xorg(未尝试启用Wayland)
  • 尝试仅连接单台显示器(无HDMI),问题仍存在

日志排查结果

dmesg错误日志输出:

dmesg --level=emerg,alert,crit,err
[    0.150278] x86/cpu: SGX disabled by BIOS.

疑问

有帖子建议在BIOS中启用SGX,请问这是否与当前死机问题相关?


内容的提问来源于stack exchange,提问作者Max

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.24 01:04:55