You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

NVMe mdadm RAID阵列I/O性能骤降问题求助

NVMe mdadm RAID阵列I/O性能骤降问题求助

大家好,我遇到了一个棘手的问题,想请各位帮忙分析排查下:

我的服务器是AMD EPYC 7502P 32核的Linux机器,内核版本为6.10.6,挂载了由6块NVMe盘组成的RAID5阵列。最近突然出现了I/O性能暴跌的情况——所有磁盘操作都变得奇慢无比,比如之前安装系统包更新最多几分钟就能搞定,现在居然要花好几个小时才能完成。

为了定位问题,我用fio工具对RAID5的文件系统做了随机写性能测试,结果发现clat(完成延迟)指标里的标准差(stdev)高得离谱,明显不符合正常NVMe盘的表现:

clat (nsec): min=190, max=359716k, avg=16112.91, stdev=592031.05

以下是完整的fio测试命令和输出结果:

$ fio --name=random-write --ioengine=posixaio --rw=randwrite --bs=4k --numjobs=1 --size=4g --iodepth=1 --runtime=60 --time_based --end_fsync=1
random-write: (g=0): rw=randwrite, bs=(R) 4096B-4096B, (W) 4096B-4096B, (T) 4096B-4096B, ioengine=posixaio, iodepth=1
fio-3.33
Starting 1 process
random-write: Laying out IO file (1 file / 4096MiB)
Jobs: 1 (f=1): [F(1)][100.0%][w=53.3MiB/s][w=13.6k IOPS][eta 00m:00s]
random-write: (groupid=0, jobs=1): err= 0: pid=48391: Wed Sep 25 09:17:02 2024
  write: IOPS=45.5k, BW=178MiB/s (186MB/s)(10.6GiB/61165msec); 0 zone resets

目前我还没找到性能暴跌的根本原因,想请教各位:这种clat标准差异常偏高的情况通常是什么诱因导致的?针对NVMe RAID阵列的I/O性能问题,我还可以开展哪些进一步的排查步骤?

备注:内容来源于stack exchange,提问作者Tombart

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.15 15:54:39