第三篇 · 进阶实战:从单集群到生产平台
前两篇让你"会看懂一台服务器、会运维一个集群"。这一篇解决的是平台级问题:
- 客户要 AI 训练集群的高性能共享存储 —— CephFS 撑不住时,GPFS ECE / Weka / VastData 这些商用并行文件系统凭什么行?怎么部署?
- 业务都跑在 K8s 上 —— PV/PVC/CSI 体系如何把存储接入云原生平台?
- 面对多个方案 —— 如何从成本/QoS/多租户/运维复杂度做选型答辩?
本篇地图
| 章节 | 定位 | 参考手册 |
|---|---|---|
| 1. GPFS ECE | 商用高性能并行文件系统代表 | k8s-in-action/storage/gpfs |
| 2. K8s 存储体系 | 云原生存储基本盘 | k8s-in-action/k8s |
| 3. Rook | 在 K8s 内运行 Ceph | k8s-in-action/storage/rook |
| 4. Ceph CSI | K8s 直连外部 Ceph | ceph-csi-rbd / ceph-csi-cephfs 指南 |
| 5. 存储方案选型 | 选型方法论与工具 | storplan.wutz.dev |
学习建议
本篇默认你已完成第二篇并能独立运维实验集群。每章的 Lab 都对应 k8s-in-action 里的真实部署指南 —— 跟着手册敲一遍,再把"为什么这样配"讲出来,就是这一篇的学法。