You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

AMD Ryzen ThreadRipper PRO 5955WX家用服务器运行Docker容器时频繁L1 BTB报错重启求助

AMD Ryzen ThreadRipper PRO 5955WX家用服务器运行Docker容器时频繁L1 BTB报错重启求助

各位大佬好,我最近在家用服务器上碰到了个棘手的硬件报错问题,折腾半天没解决,想请教下大家的思路:

服务器硬件配置

  • AMD RYZEN Threadripper PRO 5955WX
  • ASUS PRO WS WRX80E-SAGE SE WIFI
  • SAMSUNG DDR4 64GB * 8
  • Corsair HX750 80PLUS PLATINUM

问题描述

我在服务器上部署了Ubuntu 22.04的LXC容器并完成配置,LXC控制器本身启动、运行都没啥问题,但只要在容器里启动Docker容器并跑一段时间,就会触发硬件报错,最后直接导致服务器重启。相关报错日志如下:

Feb 25 02:17:01 v4 CRON[35659]: pam_unix(cron:session): session opened for user root(uid=0) by (uid=0)
Feb 25 02:17:01 v4 CRON[35660]: (root) CMD ( cd / && run-parts --report /etc/cron.hourly)
Feb 25 02:17:01 v4 CRON[35659]: pam_unix(cron:session): session closed for user root
Feb 25 02:21:37 v4 kernel: mce: [Hardware Error]: Machine check events logged
Feb 25 02:21:37 v4 kernel: [Hardware Error]: Corrected error, no action required.
Feb 25 02:21:37 v4 kernel: [Hardware Error]: CPU:1 (19:8:2) MC1_STATUS[Over|CE|MiscV|-|-|-|SyndV|-|-|-]: 0xd8200000060a0859
Feb 25 02:21:37 v4 kernel: [Hardware Error]: PPIN: 0x02b68f671f2d007b
Feb 25 02:21:37 v4 kernel: [Hardware Error]: IPID: 0x000100b000000000, Syndrome: 0x000000005a000586
Feb 25 02:21:37 v4 kernel: [Hardware Error]: Instruction Fetch Unit Ext. Error Code: 10, L1 BTB Multi-Match Error.
Feb 25 02:21:37 v4 kernel: [Hardware Error]: cache level: L1, mem/io: IO, mem-tx: IRD, part-proc: SRC (no timeout)
Feb 25 02:24:34 v4 pmxcfs[1191]: [dcdb] notice: data verification successful
Feb 25 02:31:05 v4 pvedaemon[1316]: <root@pam> successful auth for user 'root@pam'
Feb 25 02:46:30 v4 pvedaemon[1317]: <root@pam> successful auth for user 'root@pam'
Feb 25 02:52:45 v4 kernel: mce: [Hardware Error]: Machine check events logged
Feb 25 02:52:45 v4 kernel: [Hardware Error]: Corrected error, no action required.
Feb 25 02:52:45 v4 kernel: [Hardware Error]: CPU:1 (19:8:2) MC1_STATUS[Over|CE|MiscV|-|-|-|SyndV|-|-|-]: 0xd8200000060a0859
Feb 25 02:52:45 v4 kernel: [Hardware Error]: PPIN: 0x02b68f671f2d007b
Feb 25 02:52:45 v4 kernel: [Hardware Error]: IPID: 0x000100b000000000, Syndrome: 0x000000005a000581
Feb 25 02:52:45 v4 kernel: [Hardware Error]: Instruction Fetch Unit Ext. Error Code: 10, L1 BTB Multi-Match Error.
Feb 25 02:52:45 v4 kernel: [Hardware Error]: cache level: L1, mem/io: IO, mem-tx: IRD, part-proc: SRC (no timeout)
Feb 25 03:03:38 v4 pvedaemon[1315]: <root@pam> successful auth for user 'root@pam'
Feb 25 03:10:01 v4 CRON[49309]: pam_unix(cron:session): session opened for user root(uid=0) by (uid=0)
Feb 25 03:10:01 v4 CRON[49310]: (root) CMD (test -e /run/systemd/system || SERVICE_MODE=1 /sbin/e2scrub_all -A -r)
Feb 25 03:10:01 v4 CRON[49309]: pam_unix(cron:session): session closed for user root
Feb 25 03:17:01 v4 CRON[51083]: pam_unix(cron:session): session opened for user root(uid=0) by (uid=0)
Feb 25 03:17:01 v4 CRON[51084]: (root) CMD ( cd / && run-parts --report /etc/cron.hourly)
Feb 25 03:17:01 v4 CRON[51083]: pam_unix(cron:session): session closed for user root
Feb 25 03:24:34 v4 pmxcfs[1191]: [dcdb] notice: data verification successful
Feb 25 03:29:04 v4 kernel: mce: [Hardware Error]: Machine check events logged
Feb 25 03:29:04 v4 kernel: [Hardware Error]: Corrected error, no action required.
Feb 25 03:29:04 v4 kernel: [Hardware Error]: CPU:1 (19:8:2) MC1_STATUS[Over|CE|MiscV|-|-|-|SyndV|-|-|-]: 0xd8200000060a0859
Feb 25 03:29:04 v4 kernel: [Hardware Error]: PPIN: 0x02b68f671f2d007b
Feb 25 03:29:04 v4 kernel: [Hardware Error]: IPID: 0x000100b000000000, Syndrome: 0x000000005a000a98
Feb 25 03:29:04 v4 kernel: [Hardware Error]: Instruction Fetch Unit Ext. Error Code: 10, L1 BTB Multi-Match Error.
Feb 25 03:29:04 v4 kernel: [Hardware Error]: cache level: L1, mem/io: IO, mem-tx: IRD, part-proc: SRC (no timeout)
Feb 25 03:29:08 v4 pvedaemon[1317]: <root@pam> successful auth for user 'root@pam'
-- Reboot --

已尝试的解决方法

我留意到日志里反复出现 Instruction Fetch Unit Ext. Error Code: 10, L1 BTB Multi-Match Error 这句话,查了相关信息后得知这类问题通常可以通过更新主板BIOS解决,于是我已经把ASUS PRO WS WRX80E-SAGE SE WIFI的BIOS升级到了最新版本,但更新后问题依然存在,还是会频繁触发相同报错并导致重启。

有没有大佬遇到过类似的情况?或者能给我一些下一步排查的方向?麻烦大家了!

备注:内容来源于stack exchange,提问作者sanghyeon

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.23 12:44:05