Storpath
38 lessons · 5 stages · 25 hours

从认识一块硬盘,到扛起一整套集群。

这是一条写给存储运维工程师的成长路线。38 节课串成一条线: 先听懂存储这门语言,再学会读机器发出的信号,然后亲手把集群跑起来、扛住它抛来的每一次故障, 最后能替业务把账算清楚,把方案和值班手册稳稳交出去。不用纠结从哪开始 —— 顺着第一节往下走就好。

从第一节开始

已完成 0/38
0%
开始学 · 第 1 节 块、文件、对象:三种存储语义
L0
第 1 步存储原理块 / 文件 / 对象与冗余机制

不用碰任何命令行。先把存储的语言学会,后面每一节都建立在这几个词上。

0/5
  1. 1块、文件、对象:三种存储语义不是三种产品,是三种访问语义。选错语义,后面怎么调优都别扭。25m
  2. 2存储协议与接入方式iSCSI、NFS、S3、NVMe-oF 各自的开销与坑,接入前先知道。25m
  3. 3硬件基础:从 NAND 到整机选型写放大、寿命、掉电保护,这些盘的特性会一路传导到集群指标上。30m
  4. 4副本还是纠删码:冗余机制的取舍三副本浪费 67% 空间,EC 省空间但重建时能把集群拖垮。这节课算清这笔账。35m
  5. 5一致性、故障域与可用性CAP 不是屠龙术,它每天都在决定你的集群在断电时丢不丢数据。30m
L1
第 2 步系统基础Linux 性能与观测

存储跑在机器上。学会读机器给你的信号,才谈得上判断「到底慢在哪」。

0/6
  1. 1性能分析的第一课:USE 方法面对"系统慢"这种模糊报障,用一套固定套路把范围收敛到具体资源。25m
  2. 2磁盘 I/O:IOPS、吞吐与延迟的三角关系为什么队列深度一加大 IOPS 就上去、延迟也跟着上去?这节课把 iostat 每一列讲透。35m
  3. 3文件系统:从 VFS 到 XFS 挂载参数存储服务底下压着的还是本地文件系统,它的行为直接决定上层表现。30m
  4. 4CPU 与内存:存储节点的隐形瓶颈OSD 进程吃满 CPU、NUMA 跨节点访问、page cache 被挤掉,都会表现成"磁盘慢"。30m
  5. 5网络:存储集群的第二块硬盘分布式存储把网络放进了 I/O 路径,网络抖动会直接变成写延迟。30m
  6. 6观测与压测工具箱把 iostat/vmstat/perf/bpftrace 和 elbencho 串成一套可复用的手法。45m
L2
第 3 步Ceph 主战场一套集群,三种存储

先把集群跑起来,再回头讲原理,最后用四关排障把手感练出来。

0/13
  1. 1Ceph 架构总览:RADOS 与四类守护进程MON、OSD、MGR、MDS 各管什么,一次写入在集群里走过哪些环节。35m
  2. 2实验:用 cephadm 从零部署一套集群三节点起步,走完 bootstrap、加主机、加 OSD、看健康状态的全流程。60m
  3. 3实验:Rook 在 K8s 里跑 Ceph存储与计算同集群的另一条路线,Operator 帮你做了什么、藏了什么。60m
  4. 4RBD 块存储:从 pool 到挂载创建 pool、开 image、映射到主机,再把它接到 K8s 里。40m
  5. 5CephFS 文件存储:MDS 与元数据共享文件系统的甜与苦,元数据缓存是它的命门。45m
  6. 6RGW 对象存储:S3 网关把 RADOS 包装成 S3,用户、bucket、配额与多站点。40m
  7. 7Day-2 运维:扩容、换盘、升级集群跑起来只是开始,接下来两年都是这些活。50m
  8. 8闯关:HEALTH_WARN 从哪儿看起在模拟终端里接手一套告警集群,一步步定位到根因。45m
  9. 9闯关:集群完全不可用,MON 出了什么事ceph 命令直接卡住不返回。这一关练的是「管理面挂了怎么办」。40m
  10. 10闯关:CephFS 突然卡住,客户端全在等带宽正常、OSD 全绿,但 ls 一个目录要等半分钟。问题在元数据层。40m
  11. 11闯关:对象存储 5xx 激增监控报 RGW 错误率飙升,但 Ceph 集群显示 HEALTH_OK。40m
  12. 12Ceph 性能调优与压测先量再调。没有基线的调优都是玄学。50m
  13. 13CRUSH 与 PG:数据到底落在哪块盘上前面一路把集群用熟了,这节回头看它凭什么这么转 —— CRUSH 是 Ceph 最漂亮的设计。40m
L3
第 4 步容量与性能规划从需求到方案

开始算账。把业务需求翻译成机器数量、盘型号和网络配置。

0/4
  1. 1需求拆解:容量、带宽、IOPS 三条线客户说"要 1PB 高性能存储",这句话里缺了至少五个关键参数。30m
  2. 2算一遍:Ceph 集群容量规划给定裸盘配置,算出真正能用的容量 —— 交互计算器边调边看。35m
  3. 3性能估算与瓶颈定位在采购之前就算出这套配置能跑多快,以及第一个瓶颈会出现在哪。35m
  4. 4方案对比:什么时候不该用 Ceph开源不等于便宜。把授权费、运维成本、技术支持一起算进去。30m
L4
第 5 步进阶方向GPFS ECE、RDMA 网络、K8s 与商业存储

走出 Ceph 的舒适区,把散落的知识收口成可交接的流程。

0/10
  1. 1GPFS / Storage Scale 概念与 ECE 架构NSD、文件系统、集群角色 —— 换一套术语体系,但底层问题还是那些。40m
  2. 2实验:GPFS ECE 部署与调优从网络规划到 recovery group,把一套 ECE 集群跑起来。70m
  3. 3GPFS Day-2:多租户、快照与扩容fileset、配额、CES 导出、集群扩容,企业环境的日常。50m
  4. 4RDMA、InfiniBand 与 RoCE:高性能存储的入场券GPFS ECE、Weka、NVMe-oF 都跑在 RDMA 上。先弄懂它凭什么快,以及它对网络提了什么条件。40m
  5. 5实验:把 RDMA 接到存储上GPFS verbsRdma、NVMe-oF over RDMA、GPUDirect Storage —— 三条落地路径与各自的验收方法。45m
  6. 6K8s 存储模型:PV、PVC、SC 与 CSI容器时代的存储接口层,运维和开发在这里分工。35m
  7. 7实验:ceph-csi 与 gpfs-csi 接入把后端存储真正接进 K8s,并跑通快照。50m
  8. 8商业方案巡礼:Weka / VastData / XSKY知道市面上有什么、各自强在哪,选型时才不会只会推 Ceph。35m
  9. 9可观测性:指标、告警与容量水位值班靠的不是手快,是提前两周就看到容量要满了。40m
  10. 10值班手册:SOP 与故障复盘把前面所有知识固化成可交接的流程,这才是工程师的产出物。30m

顺序是建议不是限制 —— 已经有底子的话,直接跳到对应阶段也行。 想先动手,实验与闯关把全部动手环节单独汇总在了一起。