使用ceph-ansible 7在Rocky 9部署Ceph Quincy时遭遇MON_DOWN及OSD启动失败问题求助
大家好,我最近在Rocky9系统上用ceph-ansible部署Ceph Quincy版本时遇到了瓶颈,实在找不到排查方向,想向各位大佬求助。
先说说背景:我之前在相同硬件的Rocky8系统上,用ceph-ansible部署Ceph Pacific版本完全没问题。这次的集群架构是:
- 3个控制节点:同时运行mon、mgr、mdss和rgws服务
- 27个OSD节点:每个节点挂载4块NVMe磁盘作为OSD
- 网络配置:10Gbps网络,开启了巨帧(Jumbo Frames)
部署流程前期一切顺利:3个monitor成功创建,manager服务也部署完成,OSD的准备和格式化步骤都没有报错。但当执行到**"wait for all osd to be up"**这个任务时(也就是要在所有OSD节点启动OSD容器),问题突然出现:
- Monitor集群失去法定人数(quorum)
- 执行
ceph -s命令需要很久才能响应 - 并非所有OSD都能成功激活
- 最终部署失败
我截取了部分集群日志:
cluster 2023-03-06T12:00:26.431947+0100 mon.controllera (mon.0) 3864 : cluster [WRN] [WRN] MON_DOWN: 1/3 mons down, quorum controllera,controllerc
cluster 2023-03-06T12:00:26.431953+0100 mon.controllera (mon.0) 3865 : cluster [WRN] mon.controllerb (rank 1) addr [v2:20.1.0.27:3300/0,v1:20.1.0.27:6789/0] is down (out of quorum)
另外我发现一个异常情况:其中2个控制节点上的monitor容器CPU占用率一直维持在100%,以下是容器状态信息:
CONTAINER ID NAME CPU % MEM USAGE / LIMIT MEM % NET I/O BLOCK I/O PIDS 068e4e55f299 ceph-mon-controllera 99.91% 58.12MiB / 376.1GiB 0.02% 0B / 0B 122MB / 85.3MB 28 <-------- 87730f89420d ceph-mgr-controllera 0.32% 408.2MiB / 376.1GiB 0.11% 0B / 0B 181MB / 0B 35
我现在怀疑是不是资源不足导致的?比如monitor容器的CPU、内存资源不够,无法处理大量OSD启动时的并发负载?如果是这个原因的话,我该怎么验证这个猜想,又有什么调整方案呢?
感谢各位的帮助!
备注:内容来源于stack exchange,提问作者Wodel

