You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

NVMe固态硬盘疑似故障?或为主板/控制器问题?附已解决更新

NVMe固态硬盘疑似故障?或为主板/控制器问题?附已解决更新

更新:问题已解决
后来确认确实是NVMe硬盘本身的问题。我通过保持硬盘处于低温环境,极慢地逐个文件恢复数据,中途频繁休息,最终成功找回了所有数据。感谢大家的帮助!


我的系统配置如下:

  • 单块Mushkin MKNSSDPE2TB-D8型号的2TB NVMe SSD作为系统盘
  • 两块SATA硬盘组成镜像RAID阵列
  • 4周前(大概10月7日左右)安装了Ubuntu Server 22.04,当时一切正常

最近两天我往系统盘写入了约200GB的数据,期间系统多次崩溃,完全无响应,每次都需要硬重启。为了排查问题,我开始用sudo dmesg -wH命令监控内核消息缓冲区。

11月7日18:11,我往系统盘写入了一个339KB的小文件,之后系统立刻变得无响应,内核缓冲区里积累了大量错误信息,指向NVMe系统盘(也可能是控制器?):

[ +0.000027] nvme nvme0: I/O 257 QID 5 timeout, aborting
[ +0.000006] nvme nvme0: I/O 258 QID 5 timeout, aborting
[ +0.000005] nvme nvme0: I/O 259 QID 5 timeout, aborting
[ +0.000004] nvme nvme0: I/O 260 QID 5 timeout, aborting
[ +30.719233] nvme nvme0: I/O 256 QID 5 timeout, reset controller
[Nov 7 18:12] nvme nvme0: I/O 2 QID 0 timeout, reset controller

之后多个系统服务开始故障,最后出现了这些日志:

[ +0.032544] systemd[1]: Unmounting /boot/efi...
[ +0.000100] systemd[1]: Stopped Journal Service.
[ +0.001581] systemd[1]: Starting Journal Service...
[ +0.005176] systemd[1]: Stopping LVM event activation on device 259:3...
[ +0.000097] systemd[1]: Stopping Unattended Upgrades Shutdown...
[ +0.004093] systemd[1]: lvm2-pvscan@259:3.service: Deactivated successfully.
[ +0.000122] systemd[1]: Stopped LVM event activation on device 259:3.
[ +0.000869] systemd[1]: Started Journal Service.
[ +0.031798] FAT-fs (nvme0n1p1): unable to read boot sector to mark fs as dirty
[Nov 7 18:21] Core dump to |/usr/share/apport/apport pipe failed
[Nov 7 18:22] EXT4-fs warning: 126 callbacks suppressed
[ +0.000001] EXT4-fs warning (device dm-0): ext4_dx_find_entry:1791: inode #5375122: lblock 2: comm PMS ReqHandler: error -5 reading directory block
[ +0.001141] EXT4-fs warning (device dm-0): ext4_dx_find_entry:1791: inode #5375072: lblock 3: comm PMS ReqHandler: error -5 reading directory block
[ +0.000044] EXT4-fs warning (device dm-0): dx_probe:820: inode #5374089: lblock 0: comm PMS ReqHandler: error -5 reading directory block
[ +0.001368] EXT4-fs warning (device dm-0): ext4_dx_find_entry:1791: inode #5375122: lblock 6: comm PMS ReqHandler: error -5 reading directory block
[ +0.000895] EXT4-fs warning (device dm-0): dx_probe:820: inode #5374089: lblock 0: comm PMS ReqHandler: error -5 reading directory block
[ +0.012023] EXT4-fs warning (device dm-0): ext4_dx_find_entry:1791: inode #5375072: lblock 1: comm PMS ReqHandler: error -5 reading directory block
[Nov 7 18:26] Core dump to |/usr/share/apport/apport pipe failed

这时系统彻底崩溃,完全无响应,只能硬重启才能恢复。

我这是遇到NVMe硬盘故障了吗?还是主板/控制器的问题?有没有什么排查建议?我没有其他机器可以测试这块NVMe,也没有备用NVMe来测试这个系统,有点头疼……

谢谢大家!😀

备注:内容来源于stack exchange,提问作者Vince

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.21 09:23:08