Skip to content

第三篇 · 进阶实战:从单集群到生产平台

前两篇让你"会看懂一台服务器、会运维一个集群"。这一篇解决的是平台级问题:

  • 客户要 AI 训练集群的高性能共享存储 —— CephFS 撑不住时,GPFS ECE / Weka / VastData 这些商用并行文件系统凭什么行?怎么部署?
  • 业务都跑在 K8s 上 —— PV/PVC/CSI 体系如何把存储接入云原生平台?
  • 面对多个方案 —— 如何从成本/QoS/多租户/运维复杂度做选型答辩?

本篇地图

章节定位参考手册
1. GPFS ECE商用高性能并行文件系统代表k8s-in-action/storage/gpfs
2. K8s 存储体系云原生存储基本盘k8s-in-action/k8s
3. Rook在 K8s 内运行 Cephk8s-in-action/storage/rook
4. Ceph CSIK8s 直连外部 Cephceph-csi-rbd / ceph-csi-cephfs 指南
5. 存储方案选型选型方法论与工具storplan.wutz.dev

学习建议

本篇默认你已完成第二篇并能独立运维实验集群。每章的 Lab 都对应 k8s-in-action 里的真实部署指南 —— 跟着手册敲一遍,再把"为什么这样配"讲出来,就是这一篇的学法。