You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用ceph-ansible 7在Rocky 9部署Ceph Quincy时遭遇MON_DOWN及OSD启动失败问题求助

ceph-ansible 7在Rocky 9部署Ceph Quincy时遭遇MON_DOWN及OSD启动失败问题求助

大家好,我最近在Rocky9系统上用ceph-ansible部署Ceph Quincy版本时遇到了瓶颈,实在找不到排查方向,想向各位大佬求助。

先说说背景:我之前在相同硬件的Rocky8系统上,用ceph-ansible部署Ceph Pacific版本完全没问题。这次的集群架构是:

  • 3个控制节点:同时运行mon、mgr、mdss和rgws服务
  • 27个OSD节点:每个节点挂载4块NVMe磁盘作为OSD
  • 网络配置:10Gbps网络,开启了巨帧(Jumbo Frames)

部署流程前期一切顺利:3个monitor成功创建,manager服务也部署完成,OSD的准备和格式化步骤都没有报错。但当执行到**"wait for all osd to be up"**这个任务时(也就是要在所有OSD节点启动OSD容器),问题突然出现:

  • Monitor集群失去法定人数(quorum)
  • 执行ceph -s命令需要很久才能响应
  • 并非所有OSD都能成功激活
  • 最终部署失败

我截取了部分集群日志:

cluster 2023-03-06T12:00:26.431947+0100 mon.controllera (mon.0) 3864 : cluster [WRN] [WRN] MON_DOWN: 1/3 mons down, quorum controllera,controllerc
cluster 2023-03-06T12:00:26.431953+0100 mon.controllera (mon.0) 3865 : cluster [WRN] mon.controllerb (rank 1) addr [v2:20.1.0.27:3300/0,v1:20.1.0.27:6789/0] is down (out of quorum)

另外我发现一个异常情况:其中2个控制节点上的monitor容器CPU占用率一直维持在100%,以下是容器状态信息:

CONTAINER ID   NAME                   CPU %     MEM USAGE / LIMIT     MEM %     NET I/O   BLOCK I/O        PIDS
068e4e55f299   ceph-mon-controllera   99.91%    58.12MiB / 376.1GiB   0.02%     0B / 0B   122MB / 85.3MB   28  <--------
87730f89420d   ceph-mgr-controllera   0.32%     408.2MiB / 376.1GiB   0.11%     0B / 0B   181MB / 0B       35

我现在怀疑是不是资源不足导致的?比如monitor容器的CPU、内存资源不够,无法处理大量OSD启动时的并发负载?如果是这个原因的话,我该怎么验证这个猜想,又有什么调整方案呢?

感谢各位的帮助!

备注:内容来源于stack exchange,提问作者Wodel

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.23 09:44:13