1. GPFS ECE
本章目标
- 理解 GPFS(IBM Storage Scale)的核心组件与仲裁模型
- 理解 ECE(Erase Code Edition)模式与传统模式的差异
- 对照 Ceph:理解两条技术路线的取舍
1.1 GPFS 是什么
GPFS(现名 IBM Storage Scale)诞生于 1998 年,是共享磁盘并行集群文件系统的鼻祖与 HPC/AI 场景的主力。三条产品线(对照 gpfs 手册的概念篇):
- ECE(Erasure Code Edition):软件定义的存储服务器集群,SNC(shared-nothing)架构,服务端全闪高性能必须用 ECE 版
- DAE/DME 客户端:计算集群侧的挂载端(DME 支持审计日志)
- CES(NFS/SMB/S3/HDFS)+ CSI:对外协议访问层
多集群模型是 GPFS 的杀手锏:每套计算集群独立管理,可挂载远程存储集群的文件系统,mmauth 控制远程集群能看到哪些 fileset(配额、快照只对授权 fileset 可见)—— 天然的多租户。对照全局拓扑:owning cluster(存储侧)+ accessing cluster(客户端侧)正是这个模型。
1.2 核心服务组件
| 组件 | 职责 | 观测命令 |
|---|---|---|
| Config Servers(CCR) | 集群配置管理,不参与数据读写 | — |
| Cluster Manager | 仲裁选出、全集群唯一;管理租约/故障/恢复 | mmlsmgr -c |
| File Manager | 每文件系统一个;空间分配/配额 | mmlsmgr |
| NSD / pdisk | 被集群共享的物理盘(传统模式);ECE 里 pdisk 直连单台存储服务器 | mmlsnsd |
仲裁(quorum)与 Ceph MON 的 Paxos 同一问题域:用节点/盘的"票数"避免脑裂 —— 部署奇数个仲裁节点是两个系统共同的铁律。
1.3 ECE:恢复组与纠删码
ECE 把"RAID 从单机做到集群"(对照手册的规划篇):
- 恢复组(RG):3~32 台存储服务器,同 RG 内服务器配置必须一致(CPU/内存/网络/盘);一个集群最多 256 台存储节点,每台最多 64 块盘
- EC 级别:16+2P / 16+3P / 8+2p / 8+3p / 4+2p / 4+3p / 3Way / 4Way Replication
- 硬件底线:≥16 核、≥64GB 内存(64 盘配置)、存储服务器间 25Gbps+ 网络、RHEL/Rocky 8/9、系统盘 RAID1、每台至少一块 NVMe 做 ECE 日志盘
与单机 RAID 对照(第一篇):ECE 的校验块散步在 RG 的多台服务器上,一块盘/一台服务器故障时全 RG 的盘并行参与重建,重建速度远超单机 RAID5;而且禁用盘的易失写缓存来保证一致性 —— 这是它能抗住"重建窗口第二故障"的结构性原因。
1.4 与 Ceph 对照
| 维度 | Ceph | GPFS ECE |
|---|---|---|
| 数据定位 | CRUSH 全对称计算 | 元数据服务(File Manager/元数据节点) |
| 元数据扩展 | 单 active MDS 瓶颈 | 元数据节点强,但数量有限 |
| 多协议 | RBD/CephFS/RGW 三接口 | POSIX + CES(NFS/SMB/S3/HDFS) + CSI |
| 多租户 | pool/namespace 隔离 | fileset 级授权,跨集群原生 |
| 多集群 | 需 RGW multisite / 集群联邦 | 原生 remote cluster 模型 |
| 成本 | 开源 + 人力 | 商用授权 + 原厂支持 |
| AI/HPC 海量小文件 | 慎用(storplan 标注) | 主场之一 |
一句话总结:Ceph 赢在通用统一与开源生态,GPFS 赢在 HPC 场景打磨 20 多年的元数据与跨集群多租户。运维视角的关键差异:GPFS 出问题找原厂,Ceph 出问题找自己 —— 技能储备本身就是选型参数(第 5 章选型展开)。
本章小结
- GPFS 三件套:Config Server 管配置、Cluster Manager 管租约(唯一)、File Manager 管空间
- ECE = 集群级 RAID:RG 内同构服务器、EC 16+2P~4+2p、25G+ 网络、NVMe 日志盘
- 多集群 + fileset 授权 = 原生多租户,对应 owning/accessing 拓扑
- 与 Ceph 是"同题不同解":元数据集中 vs 全对称分布
自测
QuizGPFS ECE 恢复组(RG)内对存储服务器的要求是?
多选对照 Ceph 与 GPFS,下列说法正确的是?(多选)
Lab · 部署 GPFS 集群并跑分对照挑战
1. 按手册顺序学习:先读 day-0-concept(概念)与 day-0-plan-ece(规划),再走 day-1-deploy-ece 部署存储集群(含 ECE 日志 NVMe 配置)。 2. 按 day-1-deploy-dme 部署客户端集群并挂载文件系统;用 `mmlsmgr -c` / `mmlsmgr` 确认 Cluster Manager 与 File Manager。 3. 按 day-2-multi-tenant 配置一个独立 fileset 并授权给(模拟的)远程客户端。 4. 用 [elbencho](https://github.com/wutz/k8s-in-action/tree/main/storage/elbencho) 跑小文件与带宽两轮测试,与你第二篇的 Ceph 集群同规格对照(硬件不同做归一化说明)。 5. **验收标准**:产出一页对照报告(小文件 IOPS、聚合带宽、延迟分布),并回答"哪些差异来自架构,哪些来自介质/网络"。
📎 参考手册 ↗