You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

OSD加入Ceph集群后无法处于Up状态,通信报Operation not permitted错误求助

OSD加入Ceph集群后无法处于Up状态,通信报Operation not permitted错误求助

大家好,这个问题已经困扰我整整两周了,实在找不到解决方向,想请各位帮忙分析下:

之前重启K8s节点后,OSD无法加入集群,报错和认证相关。我把OSD添加到认证列表后,认证错误消失了,现在OSD能成功加入集群,但始终无法处于Up状态,执行ceph -s也看不到对应的PGs。

相关日志和状态信息

当我将ms子系统的日志级别调到20时,看到了如下错误:

4038023360,v1:10.244.135.63:6801/4038023360] conn(0x55c2deb3a000 0x55c2dd0ee000 crc :-1 s=READY pgs=2984 cs=0 l=1 rev1=1 rx=0 tx=0).handle_read_frame_preamble_main read frame preamble failed r=-1
((1) Operation not permitted)

直接登录OSD daemon查看状态,结果显示OSD处于booting状态:

[root@rook-ceph-osd-3-79b4cddd7f-52kwm ceph]# ceph daemon osd.3 status
{
"cluster_fsid": "6078f23a-41af-4f36-aa54-ddc67de63c18",
"osd_fsid": "b89817d2-3752-4f20-a916-b992990dee8d",
"whoami": 3,
"state": "booting",
"oldest_map": 9094,
"newest_map": 9677,
"num_pgs": 33
}

已尝试的排查操作

我已经做了以下排查,但都没找到问题根源:

  • 执行dmesg | grep scsi检查磁盘相关日志,输出无异常
  • 测试网络连通性:进入OSD容器ping MGR和MON节点,均能正常连通
  • 用iostat -x查看磁盘性能,磁盘利用率很低
  • 升级Rook到1.9版本,同时将Ceph升级到17版本

计划尝试的方案

目前我无奈之下只能计划尝试:

  • ZAP OSD磁盘,清理所有Ceph集群组件后重新部署

有没有哪位大佬能给点线索,帮我解决这个问题?非常感谢!

备注:内容来源于stack exchange,提问作者Ahmad Ahmadi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.22 12:37:59