You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

RHEL 7.2 Hadoop集群中i40e网卡Hung TX队列报错及内存修正错误的问题咨询

RHEL 7.2 Hadoop集群中i40e网卡Hung TX队列报错及内存修正错误的问题咨询

各位好,想请教下大家关于我们Hadoop集群遇到的问题:

我们集群有524台基于DELL硬件的RHEL机器,全部是RHEL 7.2版本,内核版本如下:

uname -r
3.10.0-327.el7.x86_64

上周发现有64台机器出现了i40e网卡相关的内核报错:

[Wed Mar 15 00:45:11 2023] i40e 0000:81:00.0 pap3: VSI_seid 388, Hung TX queue 43, tx_pending_hw: 3, NTC:0x90, HWB: 0x99, NTU: 0x9c, TAIL: 0x9c
[Wed Mar 15 00:45:11 2023] i40e 0000:81:00.0 pap3: VSI_seid 388, Issuing force_wb for TX queue 43, Interrupt Reg: 0x0

同时这些机器的dmesg里还有不少内存相关的修正错误日志,挑部分贴出来:

[Thu Mar  9 16:27:14 2023] EDAC sbridge MC0: PROCESSOR 0:406f1 TIME ---DIGITS_0058--- SOCKET 0 APIC 0
[Thu Mar  9 16:27:15 2023] EDAC MC0: 0 CE memory read error on CPU_SrcID#0_Ha#0_Chan#0_DIMM#0 (channel:0 slot:0 page:0x284b463 offset:0xa80 grain:32 syndrome:0x0 -  area:DRAM err_code:0000:009f socket:0 ha:0 channel_mask:1 rank:0)
[Thu Mar  9 16:27:37 2023] mce: [Hardware Error]: Machine check events logged
[Thu Mar  9 16:47:01 2023] {12}[Hardware Error]: Hardware error from APEI Generic Hardware Error Source: 4
[Thu Mar  9 16:47:01 2023] {12}[Hardware Error]: It has been corrected by h/w and requires no further action
[Thu Mar  9 16:47:01 2023] {12}[Hardware Error]: event severity: corrected
[Thu Mar  9 16:47:01 2023] {12}[Hardware Error]:  Error 0, type: corrected
[Thu Mar  9 16:47:01 2023] {12}[Hardware Error]:  fru_text: A1
[Thu Mar  9 16:47:01 2023] {12}[Hardware Error]:   section_type: memory error
[Thu Mar  9 16:47:01 2023] {12}[Hardware Error]:   error_status: 0x---DIGITS_0038---
[Thu Mar  9 16:47:01 2023] {12}[Hardware Error]:   physical_address: 0x---DIGITS_0057---b467b80
[Thu Mar  9 16:47:01 2023] {12}[Hardware Error]:   node: 0 card: 0 module: 0 rank: 0 bank: 3 row: 15545 column: 1000
[Thu Mar  9 16:47:01 2023] {12}[Hardware Error]:   error_type: 2, single-bit ECC
...
[Thu Mar  9 20:37:37 2023] mce: [Hardware Error]: Machine check events logged

目前我的初步想法和调研:

  • 本来考虑直接把整个集群升级到RHEL 7.9或者单独升级内核,但全集群升级工作量太大,耗时很久,有点犹豫
  • 针对i40e的报错,我查了相关信息,发现这类"Hung TX queue"和"Issuing force_wb for TX queue"的报错在2015-2017年就有记录,应该是i40e驱动的bug。当前我们的i40e驱动版本是2.22.18(2023年2月14日发布的)
  • 我知道内核升级一般会同步更新驱动,另外Intel也提供了独立安装最新驱动的方式,不需要依赖内核版本

现在想请教大家:

  1. 针对i40e的报错,优先尝试单独升级驱动还是直接推进内核/RHEL版本升级更稳妥?
  2. 内存的修正错误和i40e的报错有没有关联?需要分开排查还是一起处理?
  3. 有没有其他我没考虑到的排查或解决方向?

备注:内容来源于stack exchange,提问作者King David

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.23 10:32:40