Storpath
L4 · GPFS ECE、RDMA 网络、K8s 与商业存储

进阶方向

走出 Ceph 的舒适区。企业级高性能场景里,GPFS、RDMA 网络、Weka、VastData 和 K8s CSI 才是常态。

10 节课 · 约 7 小时已完成 0/10
  1. 1

    GPFS / Storage Scale 概念与 ECE 架构

    原理40m

    NSD、文件系统、集群角色 —— 换一套术语体系,但底层问题还是那些。

    • 说清 NSD、failure group、filesystem、cluster 的关系
    • 解释 ECE 与传统 ESS 的差别
    • 看懂 mmlscluster / mmlsnsd / mmlsfs 输出
  2. 2

    实验:GPFS ECE 部署与调优

    实验70m

    从网络规划到 recovery group,把一套 ECE 集群跑起来。

    • 完成 ECE 集群的规划与部署
    • 创建 recovery group、vdisk 与文件系统
    • 应用关键调优参数并验证效果
  3. 3

    GPFS Day-2:多租户、快照与扩容

    实验50m

    fileset、配额、CES 导出、集群扩容,企业环境的日常。

    • 用 fileset 与配额做多租户隔离
    • 配置快照策略并完成一次恢复
    • 在线扩容集群与文件系统
  4. 4

    RDMA、InfiniBand 与 RoCE:高性能存储的入场券

    原理40m

    GPFS ECE、Weka、NVMe-oF 都跑在 RDMA 上。先弄懂它凭什么快,以及它对网络提了什么条件。

    • 说清内核旁路与零拷贝为什么能同时降延迟和降 CPU
    • 区分 InfiniBand 与 RoCEv2 两条路线各自的代价
    • 解释无损网络为什么要 PFC + ECN,以及 PFC 配错会有多糟
    • 用 ibstat / ib_write_bw 判断一条 RDMA 链路是否真的可用
  5. 5

    实验:把 RDMA 接到存储上

    实验45m

    GPFS verbsRdma、NVMe-oF over RDMA、GPUDirect Storage —— 三条落地路径与各自的验收方法。

    • 给 GPFS 打开 verbsRdma 并确认它真的走了 RDMA 而不是悄悄回落 TCP
    • 搭起一条 NVMe-oF over RDMA 的链路并对比 TCP 传输的差别
    • 说清 GPUDirect Storage 省掉的是哪一次拷贝,以及它的前置条件
    • 设计一组能证明「RDMA 确实生效了」的对比测试
  6. 6

    K8s 存储模型:PV、PVC、SC 与 CSI

    原理35m

    容器时代的存储接口层,运维和开发在这里分工。

    • 说清 PV / PVC / StorageClass 三者的职责边界
    • 解释 CSI driver 的组件构成与调用链
    • 排查 PVC 一直 Pending 的常见原因
  7. 7

    实验:ceph-csi 与 gpfs-csi 接入

    实验50m

    把后端存储真正接进 K8s,并跑通快照。

    • 部署 ceph-csi 并创建可用的 StorageClass
    • 接入 gpfs-csi 并挂载已有文件系统
    • 配置 VolumeSnapshot 并完成一次恢复
  8. 8

    商业方案巡礼:Weka / VastData / XSKY

    原理35m

    知道市面上有什么、各自强在哪,选型时才不会只会推 Ceph。

    • 说出三家方案的架构特点与典型场景
    • 识别各自的隐性成本
    • 在招标场景下提出有效的技术问题
  9. 9

    可观测性:指标、告警与容量水位

    实验40m

    值班靠的不是手快,是提前两周就看到容量要满了。

    • 搭起存储集群的指标采集与看板
    • 设计不误报也不漏报的告警规则
    • 做容量趋势预测
  10. 10

    值班手册:SOP 与故障复盘

    原理30m

    把前面所有知识固化成可交接的流程,这才是工程师的产出物。

    • 写出一份别人能照着执行的处置 SOP
    • 主持一次不追责的故障复盘
    • 建立变更前的检查清单