You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Ubuntu 22.04.2 LTS服务器意外崩溃问题排查求助

Ubuntu 22.04.2 LTS服务器意外崩溃问题排查求助

看起来你的NUC服务器遇到了闹心的随机崩溃问题,先别着急重装——咱们一步步拆解排查,尽量保住你的配置。先把你描述的核心情况梳理清楚:

  • 24小时内出现两次无规律崩溃,崩溃时风扇全速运转、SSH完全无法连接,硬重启后恢复正常
  • 系统盘还有91G剩余空间,排除磁盘满的问题;近期可能做过系统更新,但以往操作无异常
  • 硬件无物理磕碰,但不排除隐性故障;dmesg有CIFS错误,但你怀疑这不是崩溃诱因

下面给你分方向的具体排查建议:

一、深挖系统日志的隐藏线索

你提供的日志片段里,kern.log中的perf: interrupt took too long提示值得重点关注——这通常和系统中断响应延迟有关,可能关联硬件或内核驱动问题。建议做这些操作:

  1. 查看崩溃前后的完整日志上下文:
    # 查看perf报错前后的详细kern.log内容
    cat /var/log/kern.log | grep -A 20 -B 20 "perf: interrupt took too long"
    # 查看上一次启动的完整系统日志(包含崩溃前状态)
    journalctl -b -1
    
  2. 排查内存不足(OOM)可能性:
    grep -i "oom\|out of memory" /var/log/syslog
    
  3. 检查syslog崩溃前几分钟的所有条目,除了jellyfin的日志,留意有没有服务异常退出、硬件报错(比如CPU温度、磁盘IO)等信息

二、硬件层面故障排查

崩溃时风扇全速,大概率和硬件负载或故障有关,按优先级检查:

  1. 温度监控:
    安装并使用传感器工具实时监控硬件温度:
    sudo apt install lm-sensors
    sensors-detect  # 检测所有硬件传感器
    watch -n 1 sensors  # 每秒刷新一次温度数据
    
    重点看CPU、主板的温度峰值,排查是否是过热触发保护导致崩溃
  2. 内存故障测试:
    随机崩溃最常见的诱因之一是内存问题。重启后在GRUB菜单选择「Advanced options for Ubuntu」,再选「Memory Test」,让它至少跑完一轮完整测试,看是否有内存校验错误
  3. 磁盘健康检查:
    用SMART工具检测系统盘的硬件健康状态:
    sudo smartctl -a /dev/sda  # 替换成你的系统盘设备名,比如/dev/nvme0n1
    
    重点关注Reallocated_Sector_Ct(重分配扇区数)、Current_Pending_Sector(待映射扇区数)这两个指标,若数值异常增长,说明磁盘有硬件故障
  4. 散热与电源检查:
    打开机箱清理内部积灰,确认风扇是否正常转动;NUC小主机的电源适配器故障也可能导致供电不稳定,有条件的话换同规格适配器测试

三、软件层面兼容性排查

  1. 系统更新的潜在问题:
    近期的系统更新可能带来内核或驱动兼容性问题:
    • 查看最近更新的内核相关包:
      sudo apt list --upgradable --installed | grep -E "(linux-image|linux-headers)"
      
    • 重启后在GRUB菜单选择旧内核启动,若旧内核下系统稳定,说明是新内核的兼容性问题,可暂时回退内核,等待后续官方更新修复
  2. CIFS挂载的潜在风险:
    虽然你觉得CIFS错误不会导致崩溃,但如果挂载的共享目录无响应,依赖它的进程可能陷入无限等待,最终拖垮系统:
    • 临时注释/etc/fstab中的CIFS挂载项,重启后观察是否还会崩溃
    • 若必须挂载CIFS,添加soft参数(比如//server/share /mnt cifs defaults,soft,username=xxx,password=xxx 0 0),让进程在共享无响应时超时退出,而非挂起系统
  3. perf事件的干扰:
    尝试临时禁用perf事件测试:
    sudo sysctl -w kernel.perf_event_max_sample_rate=0
    
    若禁用后系统稳定,可能是某个依赖perf的监控/调试工具导致冲突,可排查近期安装的相关软件
  4. 服务稳定性排查:
    崩溃前最后一条日志是jellyfin正常退出,但仍建议检查它的详细日志:
    cat /var/log/jellyfin/jellyfin.log
    
    也可以临时停止jellyfin服务,观察系统是否还会崩溃,排除服务层面的问题

四、应急备份建议

排查期间优先保住重要数据和配置:

  • 打包备份核心配置目录:
    tar czf config_backup.tar.gz /etc /home/your_username
    
  • 导出数据库等业务数据,将备份文件复制到外部存储设备

备注:内容来源于stack exchange,提问作者maximum-warning

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.22 14:53:12