RHEL 7.2 Hadoop集群中i40e网卡Hung TX队列报错及内存修正错误的问题咨询
RHEL 7.2 Hadoop集群中i40e网卡Hung TX队列报错及内存修正错误的问题咨询
各位好,想请教下大家关于我们Hadoop集群遇到的问题:
我们集群有524台基于DELL硬件的RHEL机器,全部是RHEL 7.2版本,内核版本如下:
uname -r 3.10.0-327.el7.x86_64
上周发现有64台机器出现了i40e网卡相关的内核报错:
[Wed Mar 15 00:45:11 2023] i40e 0000:81:00.0 pap3: VSI_seid 388, Hung TX queue 43, tx_pending_hw: 3, NTC:0x90, HWB: 0x99, NTU: 0x9c, TAIL: 0x9c [Wed Mar 15 00:45:11 2023] i40e 0000:81:00.0 pap3: VSI_seid 388, Issuing force_wb for TX queue 43, Interrupt Reg: 0x0
同时这些机器的dmesg里还有不少内存相关的修正错误日志,挑部分贴出来:
[Thu Mar 9 16:27:14 2023] EDAC sbridge MC0: PROCESSOR 0:406f1 TIME ---DIGITS_0058--- SOCKET 0 APIC 0 [Thu Mar 9 16:27:15 2023] EDAC MC0: 0 CE memory read error on CPU_SrcID#0_Ha#0_Chan#0_DIMM#0 (channel:0 slot:0 page:0x284b463 offset:0xa80 grain:32 syndrome:0x0 - area:DRAM err_code:0000:009f socket:0 ha:0 channel_mask:1 rank:0) [Thu Mar 9 16:27:37 2023] mce: [Hardware Error]: Machine check events logged [Thu Mar 9 16:47:01 2023] {12}[Hardware Error]: Hardware error from APEI Generic Hardware Error Source: 4 [Thu Mar 9 16:47:01 2023] {12}[Hardware Error]: It has been corrected by h/w and requires no further action [Thu Mar 9 16:47:01 2023] {12}[Hardware Error]: event severity: corrected [Thu Mar 9 16:47:01 2023] {12}[Hardware Error]: Error 0, type: corrected [Thu Mar 9 16:47:01 2023] {12}[Hardware Error]: fru_text: A1 [Thu Mar 9 16:47:01 2023] {12}[Hardware Error]: section_type: memory error [Thu Mar 9 16:47:01 2023] {12}[Hardware Error]: error_status: 0x---DIGITS_0038--- [Thu Mar 9 16:47:01 2023] {12}[Hardware Error]: physical_address: 0x---DIGITS_0057---b467b80 [Thu Mar 9 16:47:01 2023] {12}[Hardware Error]: node: 0 card: 0 module: 0 rank: 0 bank: 3 row: 15545 column: 1000 [Thu Mar 9 16:47:01 2023] {12}[Hardware Error]: error_type: 2, single-bit ECC ... [Thu Mar 9 20:37:37 2023] mce: [Hardware Error]: Machine check events logged
目前我的初步想法和调研:
- 本来考虑直接把整个集群升级到RHEL 7.9或者单独升级内核,但全集群升级工作量太大,耗时很久,有点犹豫
- 针对i40e的报错,我查了相关信息,发现这类"Hung TX queue"和"Issuing force_wb for TX queue"的报错在2015-2017年就有记录,应该是i40e驱动的bug。当前我们的i40e驱动版本是2.22.18(2023年2月14日发布的)
- 我知道内核升级一般会同步更新驱动,另外Intel也提供了独立安装最新驱动的方式,不需要依赖内核版本
现在想请教大家:
- 针对i40e的报错,优先尝试单独升级驱动还是直接推进内核/RHEL版本升级更稳妥?
- 内存的修正错误和i40e的报错有没有关联?需要分开排查还是一起处理?
- 有没有其他我没考虑到的排查或解决方向?
备注:内容来源于stack exchange,提问作者King David
相关产品推荐
相关产品推荐

