【Rook / CSI】CephCluster 生命周期:从 CR 到 mon/mgr/osd
沿 CephCluster CR 追踪 mon/mgr/osd Pod 如何被调和出来;钉设备发现前置条件、dataDirHostPath、HEALTH_OK 验证与 toolbox;说明 Rook 在 HEALTH_ERR 时默认拒绝 Ceph 升级,并对照 host 设备与 PVC 模式争论。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 4 篇文章 · 返回首页
沿 CephCluster CR 追踪 mon/mgr/osd Pod 如何被调和出来;钉设备发现前置条件、dataDirHostPath、HEALTH_OK 验证与 toolbox;说明 Rook 在 HEALTH_ERR 时默认拒绝 Ceph 升级,并对照 host 设备与 PVC 模式争论。
拆解 Rook 升级与 Ceph 滚动升级的闸门:HEALTH_ERR 拒绝、一次一个主版本、Squid/Tentacle 支持矩阵、v1.20 CSI Operator 必选迁移,以及 snapshot sidecar/CRD 错位——回应 ceph/18 点名的自动升级跳版本风险。
按六轴映射 Rook/CSI 常见故障:PVC Pending、MountFailed、RBD feature 静默失败、VolumeSnapshot 未就绪、升级卡住、mon endpoint/Secret 错配;每轴绑定 API/sidecar/CSI/Rook/Ceph 层,并回收 ceph/18 三条编排摩擦。
对比 Savepoint 与 Checkpoint 的生命周期与格式取舍;讲清 operator uid、rescale、schema evolution 规则,cancel/stop with savepoint 流程,Flink 版本升级恢复,以及 key serializer 不兼容等故障的排查与 State Processor API 边界。