NVMe固态硬盘疑似故障?或为主板/控制器问题?附已解决更新
NVMe固态硬盘疑似故障?或为主板/控制器问题?附已解决更新
更新:问题已解决
后来确认确实是NVMe硬盘本身的问题。我通过保持硬盘处于低温环境,极慢地逐个文件恢复数据,中途频繁休息,最终成功找回了所有数据。感谢大家的帮助!
我的系统配置如下:
- 单块Mushkin MKNSSDPE2TB-D8型号的2TB NVMe SSD作为系统盘
- 两块SATA硬盘组成镜像RAID阵列
- 4周前(大概10月7日左右)安装了Ubuntu Server 22.04,当时一切正常
最近两天我往系统盘写入了约200GB的数据,期间系统多次崩溃,完全无响应,每次都需要硬重启。为了排查问题,我开始用sudo dmesg -wH命令监控内核消息缓冲区。
11月7日18:11,我往系统盘写入了一个339KB的小文件,之后系统立刻变得无响应,内核缓冲区里积累了大量错误信息,指向NVMe系统盘(也可能是控制器?):
[ +0.000027] nvme nvme0: I/O 257 QID 5 timeout, aborting [ +0.000006] nvme nvme0: I/O 258 QID 5 timeout, aborting [ +0.000005] nvme nvme0: I/O 259 QID 5 timeout, aborting [ +0.000004] nvme nvme0: I/O 260 QID 5 timeout, aborting [ +30.719233] nvme nvme0: I/O 256 QID 5 timeout, reset controller [Nov 7 18:12] nvme nvme0: I/O 2 QID 0 timeout, reset controller
之后多个系统服务开始故障,最后出现了这些日志:
[ +0.032544] systemd[1]: Unmounting /boot/efi... [ +0.000100] systemd[1]: Stopped Journal Service. [ +0.001581] systemd[1]: Starting Journal Service... [ +0.005176] systemd[1]: Stopping LVM event activation on device 259:3... [ +0.000097] systemd[1]: Stopping Unattended Upgrades Shutdown... [ +0.004093] systemd[1]: lvm2-pvscan@259:3.service: Deactivated successfully. [ +0.000122] systemd[1]: Stopped LVM event activation on device 259:3. [ +0.000869] systemd[1]: Started Journal Service. [ +0.031798] FAT-fs (nvme0n1p1): unable to read boot sector to mark fs as dirty [Nov 7 18:21] Core dump to |/usr/share/apport/apport pipe failed [Nov 7 18:22] EXT4-fs warning: 126 callbacks suppressed [ +0.000001] EXT4-fs warning (device dm-0): ext4_dx_find_entry:1791: inode #5375122: lblock 2: comm PMS ReqHandler: error -5 reading directory block [ +0.001141] EXT4-fs warning (device dm-0): ext4_dx_find_entry:1791: inode #5375072: lblock 3: comm PMS ReqHandler: error -5 reading directory block [ +0.000044] EXT4-fs warning (device dm-0): dx_probe:820: inode #5374089: lblock 0: comm PMS ReqHandler: error -5 reading directory block [ +0.001368] EXT4-fs warning (device dm-0): ext4_dx_find_entry:1791: inode #5375122: lblock 6: comm PMS ReqHandler: error -5 reading directory block [ +0.000895] EXT4-fs warning (device dm-0): dx_probe:820: inode #5374089: lblock 0: comm PMS ReqHandler: error -5 reading directory block [ +0.012023] EXT4-fs warning (device dm-0): ext4_dx_find_entry:1791: inode #5375072: lblock 1: comm PMS ReqHandler: error -5 reading directory block [Nov 7 18:26] Core dump to |/usr/share/apport/apport pipe failed
这时系统彻底崩溃,完全无响应,只能硬重启才能恢复。
我这是遇到NVMe硬盘故障了吗?还是主板/控制器的问题?有没有什么排查建议?我没有其他机器可以测试这块NVMe,也没有备用NVMe来测试这个系统,有点头疼……
谢谢大家!😀
备注:内容来源于stack exchange,提问作者Vince
相关产品推荐
相关产品推荐

