Skip to content

1. GPFS ECE

本章目标

  • 理解 GPFS(IBM Storage Scale)的核心组件与仲裁模型
  • 理解 ECE(Erase Code Edition)模式与传统模式的差异
  • 对照 Ceph:理解两条技术路线的取舍

1.1 GPFS 是什么

GPFS(现名 IBM Storage Scale)诞生于 1998 年,是共享磁盘并行集群文件系统的鼻祖与 HPC/AI 场景的主力。三条产品线(对照 gpfs 手册的概念篇):

  • ECE(Erasure Code Edition):软件定义的存储服务器集群,SNC(shared-nothing)架构,服务端全闪高性能必须用 ECE 版
  • DAE/DME 客户端:计算集群侧的挂载端(DME 支持审计日志)
  • CES(NFS/SMB/S3/HDFS)+ CSI:对外协议访问层

多集群模型是 GPFS 的杀手锏:每套计算集群独立管理,可挂载远程存储集群的文件系统mmauth 控制远程集群能看到哪些 fileset(配额、快照只对授权 fileset 可见)—— 天然的多租户。对照全局拓扑:owning cluster(存储侧)+ accessing cluster(客户端侧)正是这个模型。

1.2 核心服务组件

组件职责观测命令
Config Servers(CCR)集群配置管理,不参与数据读写
Cluster Manager仲裁选出、全集群唯一;管理租约/故障/恢复mmlsmgr -c
File Manager每文件系统一个;空间分配/配额mmlsmgr
NSD / pdisk被集群共享的物理盘(传统模式);ECE 里 pdisk 直连单台存储服务器mmlsnsd

仲裁(quorum)与 Ceph MON 的 Paxos 同一问题域:用节点/盘的"票数"避免脑裂 —— 部署奇数个仲裁节点是两个系统共同的铁律。

1.3 ECE:恢复组与纠删码

ECE 把"RAID 从单机做到集群"(对照手册的规划篇):

  • 恢复组(RG):3~32 台存储服务器,同 RG 内服务器配置必须一致(CPU/内存/网络/盘);一个集群最多 256 台存储节点,每台最多 64 块盘
  • EC 级别:16+2P / 16+3P / 8+2p / 8+3p / 4+2p / 4+3p / 3Way / 4Way Replication
  • 硬件底线:≥16 核、≥64GB 内存(64 盘配置)、存储服务器间 25Gbps+ 网络、RHEL/Rocky 8/9、系统盘 RAID1、每台至少一块 NVMe 做 ECE 日志盘

与单机 RAID 对照(第一篇):ECE 的校验块散步在 RG 的多台服务器上,一块盘/一台服务器故障时全 RG 的盘并行参与重建,重建速度远超单机 RAID5;而且禁用盘的易失写缓存来保证一致性 —— 这是它能抗住"重建窗口第二故障"的结构性原因。

1.4 与 Ceph 对照

维度CephGPFS ECE
数据定位CRUSH 全对称计算元数据服务(File Manager/元数据节点)
元数据扩展单 active MDS 瓶颈元数据节点强,但数量有限
多协议RBD/CephFS/RGW 三接口POSIX + CES(NFS/SMB/S3/HDFS) + CSI
多租户pool/namespace 隔离fileset 级授权,跨集群原生
多集群需 RGW multisite / 集群联邦原生 remote cluster 模型
成本开源 + 人力商用授权 + 原厂支持
AI/HPC 海量小文件慎用(storplan 标注)主场之一

一句话总结:Ceph 赢在通用统一与开源生态,GPFS 赢在 HPC 场景打磨 20 多年的元数据与跨集群多租户。运维视角的关键差异:GPFS 出问题找原厂,Ceph 出问题找自己 —— 技能储备本身就是选型参数(第 5 章选型展开)。

本章小结

  • GPFS 三件套:Config Server 管配置、Cluster Manager 管租约(唯一)、File Manager 管空间
  • ECE = 集群级 RAID:RG 内同构服务器、EC 16+2P~4+2p、25G+ 网络、NVMe 日志盘
  • 多集群 + fileset 授权 = 原生多租户,对应 owning/accessing 拓扑
  • 与 Ceph 是"同题不同解":元数据集中 vs 全对称分布

自测

QuizGPFS ECE 恢复组(RG)内对存储服务器的要求是?
多选对照 Ceph 与 GPFS,下列说法正确的是?(多选)
🧪Lab · 部署 GPFS 集群并跑分对照挑战
⏱ 3 小时🖥 ≥3 台 RHEL/Rocky Linux + GPFS 软件包
1. 按手册顺序学习:先读 day-0-concept(概念)与 day-0-plan-ece(规划),再走 day-1-deploy-ece 部署存储集群(含 ECE 日志 NVMe 配置)。 2. 按 day-1-deploy-dme 部署客户端集群并挂载文件系统;用 `mmlsmgr -c` / `mmlsmgr` 确认 Cluster Manager 与 File Manager。 3. 按 day-2-multi-tenant 配置一个独立 fileset 并授权给(模拟的)远程客户端。 4. 用 [elbencho](https://github.com/wutz/k8s-in-action/tree/main/storage/elbencho) 跑小文件与带宽两轮测试,与你第二篇的 Ceph 集群同规格对照(硬件不同做归一化说明)。 5. **验收标准**:产出一页对照报告(小文件 IOPS、聚合带宽、延迟分布),并回答"哪些差异来自架构,哪些来自介质/网络"。
📎 参考手册 ↗

下一章:2. K8s 存储体系 →