L4
进阶方向
GPFS ECE、K8s 与商业存储走出 Ceph 的舒适区。企业级高性能场景里,GPFS、Weka、VastData 和 K8s CSI 才是常态。
8 节课 · 约 6 小时已完成 0/8
- 1
GPFS / Storage Scale 概念与 ECE 架构
原理40 分钟NSD、文件系统、集群角色 —— 换一套术语体系,但底层问题还是那些。
- →说清 NSD、failure group、filesystem、cluster 的关系
- →解释 ECE 与传统 ESS 的差别
- →看懂 mmlscluster / mmlsnsd / mmlsfs 输出
- 2
实验:GPFS ECE 部署与调优
实验70 分钟从网络规划到 recovery group,把一套 ECE 集群跑起来。
- →完成 ECE 集群的规划与部署
- →创建 recovery group、vdisk 与文件系统
- →应用关键调优参数并验证效果
- 3
GPFS Day-2:多租户、快照与扩容
实验50 分钟fileset、配额、CES 导出、集群扩容,企业环境的日常。
- →用 fileset 与配额做多租户隔离
- →配置快照策略并完成一次恢复
- →在线扩容集群与文件系统
- 4
K8s 存储模型:PV、PVC、SC 与 CSI
原理35 分钟容器时代的存储接口层,运维和开发在这里分工。
- →说清 PV / PVC / StorageClass 三者的职责边界
- →解释 CSI driver 的组件构成与调用链
- →排查 PVC 一直 Pending 的常见原因
- 5
实验:ceph-csi 与 gpfs-csi 接入
实验50 分钟把后端存储真正接进 K8s,并跑通快照。
- →部署 ceph-csi 并创建可用的 StorageClass
- →接入 gpfs-csi 并挂载已有文件系统
- →配置 VolumeSnapshot 并完成一次恢复
- 6
商业方案巡礼:Weka / VastData / XSKY
原理35 分钟知道市面上有什么、各自强在哪,选型时才不会只会推 Ceph。
- →说出三家方案的架构特点与典型场景
- →识别各自的隐性成本
- →在招标场景下提出有效的技术问题
- 7
可观测性:指标、告警与容量水位
实验40 分钟值班靠的不是手快,是提前两周就看到容量要满了。
- →搭起存储集群的指标采集与看板
- →设计不误报也不漏报的告警规则
- →做容量趋势预测
- 8
值班手册:SOP 与故障复盘
原理30 分钟把前面所有知识固化成可交接的流程,这才是工程师的产出物。
- →写出一份别人能照着执行的处置 SOP
- →主持一次不追责的故障复盘
- →建立变更前的检查清单