学习路线:从毕业到存储工程师
这条路线为应届毕业生设计,假设你熟悉基本 Linux 命令、写过一点代码,但没有接触过生产级存储系统。
总览
text
阶段一 系统基础 阶段二 Ceph 统一存储 阶段三 进阶实战
(2~4 周) (4~8 周) (4~8 周)
┌─────────────────┐ ┌─────────────────┐ ┌─────────────────┐
│ Linux 存储栈 │ │ RADOS 架构 │ │ GPFS ECE │
│ 观测工具箱 │ ──────▶ │ RBD/CephFS/RGW │ ──────▶ │ K8s PV/PVC/CSI │
│ USE 方法论 │ │ cephadm 部署 │ │ Rook/Ceph CSI │
│ 块设备与文件系统 │ │ 运维与故障处理 │ │ 方案选型 │
└─────────────────┘ └─────────────────┘ └─────────────────┘
会看懂一台服务器 会独立运维一个集群 会面对一个平台阶段一:系统基础(必须扎实)
存储运维的本质是在延迟、带宽、容量、可靠性之间做权衡,而这些权衡最终都落在操作系统层面:页缓存、块层队列、网络往返、文件系统语义。跳过这一步直接学 Ceph,遇到性能问题时只能背答案,无法推理。
- 学习材料:《Systems Performance, 2nd Edition》(Brendan Gregg)
- 目标:能对一个 IO 慢的问题给出有工具证据的定位结论
- 出关标准:完成 3. 性能分析方法论 的综合 Lab
阶段二:Ceph 统一存储(核心技能)
Ceph 是开源分布式存储的事实标准,也是唯一一个同时提供块、文件、对象三种接口的系统。学好 Ceph,再学任何其他存储系统都是"对照差异"而不是"从零开始"。
- 部署实操参考:k8s-in-action/storage/cephadm 部署指南
- 目标:独立部署一个 3 节点以上集群,并跑通三种存储接口
- 出关标准:完成 6. 日常运维与故障处理 的全部故障演练
阶段三:进阶实战(面向岗位竞争力)
- GPFS ECE:商用高性能并行文件系统的代表,AI/HPC 场景主力(参考 k8s-in-action 的 gpfs 部署指南)
- K8s 存储:云原生存储的基本盘 —— PV/PVC/CSI 体系、Rook、Ceph CSI(参考 k8s-in-action 的 rook、ceph-csi-rbd、ceph-csi-cephfs 部署指南)
- 方案选型:结合 storplan.wutz.dev 容量与性能规划工具,学习从成本/QoS/多租户维度做选型
怎么使用本站
- 按顺序学:三篇之间有依赖,跨阶段跳读适合有基础的同学
- 每章先读、再 Quiz、最后 Lab:Quiz 不过关不建议进入下一章
- Lab 在真实环境做:推荐用 3 台虚拟机或开发机组网演练,命令都可以在部署指南里找到