Skip to content

5. 存储方案选型

本章目标

  • 建立"接口 → 负载 → 短名单 → 成本/风险"的选型流程
  • 会用 storplan 做容量/性能/成本演算
  • 能写一份经得起评审的选型报告

5.1 选型四步法

text
① 接口匹配:应用怎么访问?(块/文件/对象/POSIX/S3/CSI)
② 负载画像:IOPS 型 or 带宽型?小文件 or 大对象?读写比?峰值形态?
③ 短名单 + POC:2~3 个候选,实测(fio/elbencho/s3 压测)
④ 决策:TCO + QoS + 多租户 + 团队技能 + 风险

多数选型失败不是选错了产品,而是跳过了①②直接比参数表

5.2 方案速查(对照 storplan 选型表)

类别方案定位与注意
高性能文件VastData / GPFS ECE / WekaAI/HPC 主战场,商用支持
高性能文件CephFS开源统一存储;AI 场景慎用(MDS 元数据瓶颈,storplan 明确标注)
对象XSKY XEOS / Ceph RGW / VastData S3S3 生态、备份归档、冷热分层
VastData Block / Ceph RBD虚拟化/云盘/数据库

三条决策经验:

  1. QoS/多租户硬需求推商用:开源方案的多租户隔离与 QoS 能力普遍弱于商用(GPFS 的 fileset 授权、Vast 的 DASE 架构为此而生)
  2. 团队技能是隐藏成本:Ceph 便宜但"原厂支持"贵在人力 —— 第二篇全部内容就是这份人力账单
  3. 统一存储的诱惑要警惕:一套集群三种接口 = 故障域也统一;关键业务与备份归档是否真的该同生共死?

5.3 实战流程(本篇 Lab 的骨架)

text
需求采集 → storplan 演算 → POC(实测校准)→ TCO 对比 → 风险评审 → 答辩
   │           │              │
   │           │              └─ elbencho/fio/s5cmd,用第二、三篇的测量技能
   │           └─ 输入容量/带宽 → 输出节点/盘/网配置与成本
   └─ 容量与增长(第二篇 7.5 时间线)、延迟与 RPO/RTO、并发与多租户

POC 纪律:同硬件、同负载模型、同报告格式,否则对比无效 —— 这是把第一篇基线思想用到选型上。

TCO 公式(5 年):

text
硬件 + 软件授权/订阅 + 部署实施 + 运维人力(人月×成本)+ 培训 + 停机风险成本
开源≠便宜:省下的授权费会出现在人力与培训两栏

5.4 报告模板(10 页以内)

  1. 需求摘要(一页表格:容量/带宽/IOPS/延迟/增长/RPO-RTO/多租户)
  2. 候选方案与淘汰理由(含放弃方案 —— 评审最信服的部分)
  3. POC 数据(每方案同格式:小文件 IOPS、聚合带宽、P99、故障恢复时间)
  4. TCO 对比(5 年,分栏公式)
  5. 风险与对策(技能储备、供应商锁定、扩容路径)
  6. 结论与分阶段实施建议

本章小结

  • 四步法:接口 → 负载 → 短名单 → TCO/风险;参数表对比是最差的起点
  • QoS/多租户硬需求与团队技能是开源 vs 商用的两个隐形天平
  • POC 三同纪律:同硬件、同负载、同报告
  • 放弃方案的理由是报告最有说服力的部分

自测

Quiz客户需求:AI 训练平台,数千 GPU 并发读小文件数据集,峰值读带宽 100GB/s,多租户隔离强需求。storplan 选型表框架下最应该优先评估的组合是?
多选关于 TCO 与选型决策,合理的判断包括?(多选)
🧪Lab · 模拟一次真实选型答辩挑战
⏱ 2 小时🖥 storplan + 前三篇的实测数据
场景:客户需要 AI 训练平台存储 —— 2PiB 有效容量、读 100GB/s 聚合带宽、千卡 GPU 并发读小文件、多租户隔离、预算敏感。 1. 用 storplan 对比 GPFS ECE / Weka / Ceph 全闪三套配置,记录每套的节点/盘/网与成本输出。 2. 用你实验集群的实测数据(第二、三篇 Lab 产物)支撑性能论据,说明哪些数字可信、哪些需要 POC 补测。 3. 按 5.4 模板写 ≤10 页报告,做 10 分钟答辩(同伴/同事扮演评审,至少提 3 个刁钻问题)。 4. **验收标准**:评审问不倒 —— 每个数字有出处(storplan/实测/假设三选一并标注),每个风险有对策,每个被淘汰方案有理由。
📎 参考手册 ↗

上一章 · 回到学习路线 · [🎓 恭喜完成全部课程]