SStorpath
L4

进阶方向

GPFS ECE、K8s 与商业存储

走出 Ceph 的舒适区。企业级高性能场景里,GPFS、Weka、VastData 和 K8s CSI 才是常态。

8 节课 · 约 6 小时已完成 0/8
  1. 1

    GPFS / Storage Scale 概念与 ECE 架构

    原理40 分钟

    NSD、文件系统、集群角色 —— 换一套术语体系,但底层问题还是那些。

    • 说清 NSD、failure group、filesystem、cluster 的关系
    • 解释 ECE 与传统 ESS 的差别
    • 看懂 mmlscluster / mmlsnsd / mmlsfs 输出
  2. 2

    实验:GPFS ECE 部署与调优

    实验70 分钟

    从网络规划到 recovery group,把一套 ECE 集群跑起来。

    • 完成 ECE 集群的规划与部署
    • 创建 recovery group、vdisk 与文件系统
    • 应用关键调优参数并验证效果
  3. 3

    GPFS Day-2:多租户、快照与扩容

    实验50 分钟

    fileset、配额、CES 导出、集群扩容,企业环境的日常。

    • 用 fileset 与配额做多租户隔离
    • 配置快照策略并完成一次恢复
    • 在线扩容集群与文件系统
  4. 4

    K8s 存储模型:PV、PVC、SC 与 CSI

    原理35 分钟

    容器时代的存储接口层,运维和开发在这里分工。

    • 说清 PV / PVC / StorageClass 三者的职责边界
    • 解释 CSI driver 的组件构成与调用链
    • 排查 PVC 一直 Pending 的常见原因
  5. 5

    实验:ceph-csi 与 gpfs-csi 接入

    实验50 分钟

    把后端存储真正接进 K8s,并跑通快照。

    • 部署 ceph-csi 并创建可用的 StorageClass
    • 接入 gpfs-csi 并挂载已有文件系统
    • 配置 VolumeSnapshot 并完成一次恢复
  6. 6

    商业方案巡礼:Weka / VastData / XSKY

    原理35 分钟

    知道市面上有什么、各自强在哪,选型时才不会只会推 Ceph。

    • 说出三家方案的架构特点与典型场景
    • 识别各自的隐性成本
    • 在招标场景下提出有效的技术问题
  7. 7

    可观测性:指标、告警与容量水位

    实验40 分钟

    值班靠的不是手快,是提前两周就看到容量要满了。

    • 搭起存储集群的指标采集与看板
    • 设计不误报也不漏报的告警规则
    • 做容量趋势预测
  8. 8

    值班手册:SOP 与故障复盘

    原理30 分钟

    把前面所有知识固化成可交接的流程,这才是工程师的产出物。

    • 写出一份别人能照着执行的处置 SOP
    • 主持一次不追责的故障复盘
    • 建立变更前的检查清单